https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=1293357

Wan Streamer v0.1, 실시간 AI 여자친구와 영상 통화하기Wan Streamer v0.1, 실시간 영상 대화를 하나의 트랜스포머에 담다 알리바바 Wan Team의 네이티브 스트리밍 엔드투엔드 음성·영상 상호작용 모델 · 프로젝트 페이지 공개일 2026년 6월 24일 ·gall.dcinside.com






이 글은 Wan Streamer 공식 프로젝트 페이지와 arXiv 논문을 기준으로 정리한 요약이다. 비교표의 타 시스템 수치는 Wan Team이 공개된 수치 중 가까운 값을 모아 제시한 것으로, 측정 경계가 서로 섞여 있다. 따라서 아래 비교는 독립 벤치마크라기보다 저자 측 문제의식과 포지셔닝을 보여 주는 자료로 읽어야 한다.

Wan Streamer는 사람과 실시간으로 얼굴을 마주 보고 대화하는 상황을 하나의 모델 안에서 처리하도록 설계된 엔드투엔드 파운데이션 모델이다. 알리바바 Wan Team은 이 모델이 사용자의 말과 영상을 받아들이면서 동시에 생각하고, 음성과 영상으로 응답한다고 설명한다. 핵심은 언어, 음성, 영상을 입력과 출력 양쪽에서 단일 트랜스포머로 모델링한다는 점이다. 공식 설명에 따르면 외부 VAD, 음성 인식(ASR), 언어 모델, 음성 합성(TTS), 오디오 구동 애니메이션, 영상 생성 모듈에 의존하지 않는다. 다만 이것은 내부 토크나이저, 인코더, 디코더, VAE 같은 구성 요소가 없다는 뜻이 아니라, 상호작용 파이프라인이 별도 모델들의 계단식 조합이 아니라는 뜻이다.

생성 조건은 25fps이며, 모델 측 응답 지연은 약 200ms로 제시됐다. 양방향 네트워크 지연 350ms를 포함한 총 상호작용 지연은 약 550ms다. Wan Team은 이를 통해 1초 미만의 음성·영상 전이중 상호작용이 가능하다고 주장한다.

핵심 사양

생성 조건 25fps
스트리밍 단위 최소 160ms
모델 측 지연 약 200ms
총 상호작용 지연 약 550ms (양방향 네트워크 지연 350ms 포함)
v0.1 출력 해상도 192p (개념 검증 단계)

Wan Streamer 총체 구조. 언어와 음성, 영상을 하나의 트랜스포머 안에서 입력이자 출력으로 함께 모델링하고, block-causal attention으로 조율해 증분식 스트리밍 생성을 수행한다.