VisionAIDocs
GitHub
REAL-TIME DIGITAL HUMAN

아바타에 목소리를.
대화에 생동감을.

VisionAI으로 실시간 립싱크 영상을 만들고 재생하세요.
첫 연결부터 나만의 아바타까지, 한곳에서 안내합니다.

Mac 실행 확인 한국어 TTS WebRTC 재생
텍스트나 음성이, 말하는 영상으로.

음성에 맞춰 입 모양을 생성하고 브라우저로 전달하는 오픈소스 아바타 엔진입니다.

OPEN SOURCE

어디서 시작할까요?

단계별로, 필요한 만큼.

이렇게 동작합니다

입력부터 화면까지, 하나의 흐름.
1텍스트 / 음성문장 또는 오디오 입력
2음성 생성TTS 또는 업로드 음성
3립싱크 생성얼굴과 입 모양 합성
4실시간 재생WebRTC로 브라우저에

AI 대화가 필요하면 텍스트 입력 앞에 STT와 LLM을 연결할 수 있습니다. 현재 테스트는 텍스트 → TTS → 영상 재생에 집중했습니다.

직접 확인한 아바타

실제 실행 결과
한국어 립싱크 테스트 녹화
CUSTOM AVATAR

8초의 영상에서,
새로운 인물로.

정면을 보는 마지막 2.5초로 생성한 아바타입니다. 한국어 남성 TTS를 입력해 실제 WebRTC 재생을 확인했습니다.

출력 해상도
1280 × 720
브라우저 수신
약 25 fps
생성 프레임
63 frames
생성 과정 보기

위 영상은 실시간 테스트를 녹화한 파일입니다. 이 문서 사이트가 아바타를 실시간으로 생성하는 것은 아닙니다. 짧은 테스트의 측정값이며, 원본의 Veo 워터마크를 유지했습니다.

참고 자료

이 가이드는 2026년 9월 17일의 로컬 설치 소스와 테스트 결과를 기준으로 작성했습니다. 원본 프로젝트와 다른 로컬 연결 수정 사항은 연결 가이드에 표시했습니다.
VisionAI 사용자 가이드실시간 아바타를 위한 작은 안내서.
문서 제목과 본문을 검색합니다.Enter로 첫 결과 열기