추가 TTS 후보
한국어를 지원하는 추가 TTS 8개를 비교하고, Mac 로컬 실행·클라우드 API·VisionAI 연결에 필요한 작업을 확인합니다.
현재 설치의 TTS 옵션 외에도 한국어 음성을 만들 수 있는 서비스와 모델이 있습니다. 2026-09-17에 공식 문서·모델 저장소를 확인한 추가 후보를 정리했습니다. 아래 후보는 현재 Mac의 VisionAI에 설치하거나 연결해 실행한 결과가 아닙니다.
Qwen3-TTS와 Fish Speech는 기존 omnitts 뒤에서 사용할 실제 모델을 확장하는 후보이며, 나머지는 별도 서비스나 실행 경로입니다. 후보 이름을 YAML의 tts에 넣는 것만으로 현재 설치에서 활성화되지는 않습니다.
후보 비교
| 후보 | 한국어 지원 근거 | 실행 위치 | 주요 용도 | 현재 VisionAI에 연결하려면 |
|---|---|---|---|---|
| Qwen3-TTS + MLX Audio | Qwen 모델·MLX Audio 지원표에 한국어 포함 | Apple Silicon Mac 또는 별도 서버 | 로컬 기성 음성·음성 복제·음성 디자인 | MLX용 어댑터 또는 API 중계 구성. vLLM 경로는 omnitts 호환 검증 |
| Supertonic 3 | 공식 모델의 ko 언어 지원 |
로컬 CPU·ONNX Runtime | 가벼운 로컬 기성 음성 | ONNX용 어댑터 또는 별도 HTTP 서버. 공식 개발·지원 종료 상태 확인 |
| Fish Speech S2 Pro | 공식 모델의 한국어 지원 목록 | 별도 모델 서버 | 참조 음성·표현 제어 | omnitts 호환 서버 검증 또는 전용 어댑터 추가 |
| ElevenLabs | Flash v2.5·Multilingual v2 등의 지원표 | 클라우드 | 스트리밍 음성·제공자 화자 사용 | API 키·voice ID와 전용 어댑터 추가 |
| Cartesia Sonic | Sonic 3.6의 ko 지원표 |
클라우드 | 실시간 음성 응답 | API 인증·voice ID와 WebSocket 또는 HTTP 어댑터 추가 |
| OpenAI TTS | 공식 TTS 안내의 한국어 목록 | 클라우드 | 기성 음성·지시문으로 말투 제어 | 인증·모델 지정·오디오 처리를 갖춘 어댑터 추가 |
| NAVER CLOVA Voice | 공식 API의 한국어 speaker 목록 | 클라우드 | 한국어 안내·내레이션 | 인증·speaker 지정·MP3/WAV 해석 어댑터 추가 |
| Google Cloud TTS | Chirp 3: HD의 ko-KR 지원표 |
클라우드 | 한국어 기성 음성·양방향 스트리밍 | Google 인증과 SDK/API 어댑터 추가 |
한국어가 지원 언어에 있다는 사실과 한국어 발음·억양이 용도에 맞는다는 판단은 다릅니다. 같은 문장을 들어 보고 선택하세요. 클라우드는 서비스 이용료와 계정별 권한을, 로컬 모델은 실행 자원과 선택한 가중치의 사용 조건을 확인합니다.
Qwen3-TTS와 MLX Audio
Qwen3-TTS는 한국어를 포함한 다국어 TTS 모델입니다. CustomVoice는 준비된 화자, Base는 참조 음성 기반 복제, VoiceDesign은 문장으로 설명한 목소리 생성에 쓰는 모델입니다. 기성 음성 모델에 참조 WAV를 넣는 방식으로 모든 기능을 사용할 수 있는 것은 아닙니다. Qwen3-TTS 공식 모델 설명
현재 Mac에서는 MLX Audio로 실행하는 경로를 먼저 검토할 수 있습니다. MLX Audio는 Apple Silicon용 실행 라이브러리이며, Qwen3-TTS 한국어 지원과 양자화 모델·스트리밍 생성 예제를 제공합니다. 예제로 소개된 mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit는 기성 음성 시험의 출발점입니다. 음성 복제는 Base 모델을 따로 검토합니다. MLX Audio의 모델 지원과 실행 예제
MLX Audio는 /v1/audio/speech 서버도 제공하지만, 현재 omnitts를 주소만 바꿔 바로 연결할 수 있다고 검증하지는 않았습니다. 현재 어댑터는 요청에 model을 넣지 않고 vLLM용 task_type 등을 전송합니다. 모델 선택, 언어·화자 매개변수와 출력 형식을 맞추는 MLX용 어댑터나 중계 계층을 검토해야 합니다.
별도 하드웨어에서 vLLM Omni로 Qwen3-TTS를 제공한다면 기존 omnitts 경로를 검토할 수 있습니다. MLX와 vLLM은 같은 서버가 아니며, 각각의 요청 규약과 실제 스트리밍 출력을 시험해야 합니다.
Supertonic 3
Supertonic 3는 ONNX Runtime으로 로컬 실행하는 소형 다국어 TTS입니다. 공식 안내는 한국어 ko, CPU 실행, 약 99M 매개변수와 44.1kHz WAV 출력을 설명합니다. 별도 클라우드 API를 호출하지 않는 기성 음성 생성 경로로 검토할 수 있습니다. 공식 보관 저장소와 기능 설명
2026-09-09에 공식 저장소가 보관 상태로 전환됐으며 개발과 지원이 종료됐습니다. 소스와 모델은 보관용 주소에 남아 있지만 업데이트나 버그 수정이 제공되는 후보로 안내하지 않습니다. 오래된 자료의 데모·Voice Builder 제공 안내도 현재 가용성과 구분해야 합니다. 공식 지원 종료 안내
기존 음성 스타일로 오디오를 만드는 시험과 사용자 목소리 복제는 구분합니다. 공개 모델의 기성 음성 시험을 기준으로 검토하며, 생성한 WAV를 먼저 Audio Driver에 넣어 립싱크를 확인할 수 있습니다. 모델을 VisionAI 안에서 직접 구동하려면 ONNX용 어댑터가 필요합니다.
보관된 Python SDK에는 /v1/audio/speech 호환 서버 안내도 있습니다. 단, 현재 omnitts의 언어·task·스트리밍 처리와 맞는지는 별도 확인해야 합니다. 샘플 코드는 MIT, 모델은 별도 OpenRAIL-M 조건으로 안내되어 있습니다. 보관 모델 카드, Python HTTP 서버 안내
Fish Speech S2 Pro
Fish Speech S2 Pro는 한국어를 지원하는 다국어 TTS 모델이며, 참조 음성과 표현 제어를 활용하는 후보입니다. 공식 저장소는 vLLM Omni를 통한 서버 실행 자료도 연결합니다. Fish Speech 공식 모델·언어 안내
현재 Mac의 첫 로컬 후보로는 Qwen3-TTS의 MLX 경로를 먼저 검토합니다. Fish의 공식 설치 문서는 CUDA·CPU 등의 경로를 설명하고, Docker CUDA 추론 구성에는 최소 24GB GPU 메모리를 안내합니다. 이 요구사항을 Mac의 18GB 통합 메모리와 동일하게 취급하거나 Mac 실시간 실행이 된다고 판단할 수 없습니다. 별도 서버의 자원과 선택한 실행 경로를 먼저 확인하세요. 공식 설치와 하드웨어 조건
현재 VisionAI의 fishtts 전용 매핑은 주석 처리되어 있습니다. 서버가 omnitts 요청과 출력에 호환되면 기존 어댑터를 검토할 수 있지만, 모델별 샘플레이트·화자 등록·참조 음성 전달을 확인해야 합니다. 현재 omnitts에는 참조 음성 업로드가 포함되지 않습니다.
ElevenLabs
ElevenLabs는 API로 화자를 지정해 음성을 합성하는 클라우드 서비스입니다. 공식 지원표에는 Flash v2.5와 Multilingual v2의 한국어가 포함됩니다. Flash는 실시간 응답을, Multilingual v2는 내레이션 등 지속적인 음성 품질을 비교할 때 검토할 수 있습니다. Eleven v3도 한국어를 지원하지만, 모델별 기능과 endpoint 호환성은 별도로 확인해야 합니다. 공식 모델 비교와 언어 목록
POST /v1/text-to-speech/{voice_id}/stream은 음성 응답을 HTTP 스트림으로 반환합니다. 연결에는 API 키와 접근 가능한 voice_id, 선택한 model_id가 필요합니다. 출력은 MP3·PCM 등 선택한 형식에 맞춰 해석해야 합니다. 음성·출력 옵션은 계정과 모델의 사용 조건도 확인합니다. 공식 스트리밍 API
현재 설치에는 ElevenLabs 어댑터가 없습니다. 먼저 생성 파일을 Audio Driver로 재생할 수 있고, 텍스트를 직접 보내며 재생하려면 API 호출과 오디오 전달을 담당하는 어댑터를 추가해야 합니다. 서비스에서의 스트리밍 지원을 VisionAI 전체 발화 지연 수치로 환산하지 않습니다.
Cartesia Sonic
Cartesia Sonic은 실시간 음성 합성을 제공하는 클라우드 모델 계열입니다. 확인 시점의 공식 최신 문서는 Sonic 3.6을 안내하고 한국어 ko를 지원 언어에 포함합니다. 기존 글의 sonic-2·sonic-turbo 설정을 그대로 복사하기보다 현재 모델과 음성의 가용성을 확인합니다. 현재 모델과 한국어 지원표
WebSocket API는 문장과 voice ID를 보내고 음성 데이터를 받는 방식이며, raw PCM의 encoding과 샘플레이트를 지정하는 규약을 제공합니다. 이 구조는 아바타의 오디오 조각 전달에 연결할 후보입니다. 공식 WebSocket API
현재 설치에는 Cartesia 어댑터가 없습니다. 제공자 인증, 텍스트·음성 ID 매핑, 오디오 응답 해석과 발화 중단 처리를 구현해야 합니다. 한국어 사용에서는 ko 설정과 선택한 화자가 한국어 문장·숫자·외래어를 어떻게 읽는지 함께 확인합니다.
OpenAI TTS
OpenAI의 Speech API는 gpt-4o-mini-tts 등으로 텍스트를 음성으로 만듭니다. 한국어가 지원 언어에 포함되며, 지시문으로 말투를 조절하는 기능과 음성 응답 스트리밍을 제공합니다. 기본 음성은 영어에 최적화되어 있으므로 한국어 발음과 억양은 실제 문장으로 비교합니다. OpenAI 공식 TTS 문서
연결할 때 model, voice, input, 인증 정보를 지정해야 합니다. PCM 출력은 24kHz·16bit의 헤더 없는 오디오이므로, VisionAI의 16kHz로 변환하는 경로를 구성할 수 있습니다. 사용자 지정 음성은 별도 자격·등록 절차가 있는 기능이며, 기존 참조 파일 설정만으로 생성되지 않습니다. 출력 형식과 사용자 지정 음성 안내
현재 omnitts의 TTS_SERVER를 OpenAI 주소로 바꾸는 것만으로는 연결되지 않습니다. 현재 코드는 인증 헤더와 model을 보내지 않고 vLLM 확장 필드를 사용합니다. 공식 API에 맞는 어댑터가 필요합니다. 이 문서 추가에서는 API 키 설정이나 유료 합성 요청을 수행하지 않았습니다.
NAVER CLOVA Voice
CLOVA Voice는 한국어 speaker를 포함한 음성 합성 서비스입니다. 공식 API는 speaker와 텍스트를 받아 MP3 또는 WAV 음성을 반환하며, 속도·음량·피치·감정 등의 옵션을 설명합니다. 옵션의 지원 범위는 선택한 speaker에 맞춰 확인합니다. 한국어 안내 방송이나 내레이션용 기성 음성을 비교할 때 검토할 수 있습니다. CLOVA Voice 공식 TTS API
현재 설치에는 CLOVA Voice 어댑터가 없습니다. 제공자 인증과 speaker를 설정하고 응답 파일을 해석하는 어댑터가 필요합니다. 공식 API의 음성 파일 반환을 텍스트·음성 양방향 스트리밍과 같은 방식으로 안내하지 않습니다. 먼저 짧은 문장의 파일을 생성해 Audio Driver에서 재생하는 경로를 검토할 수 있습니다.
Google Cloud TTS
Google Cloud Text-to-Speech의 Chirp 3: HD는 한국어 ko-KR를 지원합니다. 준비된 음성 중 화자를 고르는 관리형 서비스이며, 정확한 voice 이름과 사용 가능한 리전을 확인합니다. Chirp 3: HD의 언어와 리전 안내
공식 스트리밍 안내는 텍스트를 보내면서 음성을 받는 양방향 스트리밍 합성을 설명하며, 해당 경로는 Chirp 3: HD 음성과 호환됩니다. 일반 TTS의 모든 음성에 같은 스트리밍 기능을 적용할 수 있다고 판단하지 않습니다. 양방향 스트리밍 합성 예제
현재 설치에는 Google Cloud 어댑터가 없습니다. Cloud 프로젝트와 인증, SDK/API 연결, 음성 이름, 출력 오디오 변환을 준비해야 합니다. 파일 합성부터 시험할지 스트리밍부터 연결할지 선택하고, 브라우저에서 실제 첫 오디오와 영상이 도착하는 시간을 측정합니다.
현재 Mac에서의 검토 순서
로컬 실행이 목적이면 Qwen3-TTS + MLX Audio부터 검토하는 것을 제안합니다. Apple Silicon 실행 경로가 문서화되어 있고 기성 음성과 음성 복제 모델을 나눠 시험할 수 있기 때문입니다. 0.6B 양자화 모델로 먼저 기성 음성을 만들어 보고, Wav2Lip과 동시에 실행할 때 메모리 사용량·발화 시작 시간·영상 FPS를 확인합니다. 이 순서는 공식 기능과 현재 환경을 바탕으로 한 제안이며 실행 성능을 측정한 결론은 아닙니다.
| 우선 확인할 목표 | 후보 | 첫 확인 |
|---|---|---|
| Mac에서 한국어 음성을 로컬 생성 | Qwen3-TTS + MLX Audio | 한국어 WAV 생성과 Wav2Lip 동시 실행 자원 |
| 가벼운 CPU 기성 음성 실험 | Supertonic 3 | 보관 모델 다운로드·지원 종료 수용 여부 |
| 실시간 클라우드 음성 | ElevenLabs Flash, Cartesia Sonic, OpenAI TTS | 같은 짧은 문장의 첫 오디오 지연·한국어 발음 |
| 한국어 안내·내레이션 음성 | CLOVA Voice, Google Cloud TTS | speaker별 숫자·이름·외래어 발음 |
| 별도 모델 서버에서 표현·참조 음성 실험 | Fish Speech S2 Pro | 서버 자원과 참조 음성·스트리밍 API 호환성 |
한국어 용도에서는 영어 전용·한국어 지원이 확인되지 않은 모델을 같은 후보로 취급하지 않습니다. 예를 들어 MLX Audio의 현재 지원표에서 KittenTTS는 영어, Kokoro는 한국어가 포함되지 않은 언어 목록으로 안내됩니다. 모델 이름의 인기나 Mac 실행 가능성만으로 한국어 용도에 맞다고 판단하지 않습니다. MLX Audio 모델별 언어 지원표
VisionAI 연결 경로
파일로 먼저 확인하는 경로는 어댑터를 추가하기 전에 음질과 립싱크를 비교할 때 유용합니다. 후보에서 음성 파일을 만들고 현재 페이지의 Audio Driver → Upload & Play로 재생합니다. 이 과정은 파일 입력이며, 텍스트를 바로 읽거나 연속 스트리밍하는 기능을 추가하지는 않습니다. 음성 파일 API
텍스트를 직접 읽는 경로는 기존 호환 어댑터를 검증하거나 새 어댑터를 추가하는 작업입니다. 새 엔진은 BaseTTS를 상속해 플러그인으로 등록하고 avatars/base_avatar.py의 모듈 매핑에 연결합니다. 생성 음성을 16kHz 모노로 변환해 기본 25fps 기준 20ms 단위로 전달하고, 발화 시작·끝·중단 동작을 맞춥니다. 인증·화자·모델·참조 파일 항목은 제공자 요청 규약에 맞춰 구성합니다.
호환 API 서버를 사용하는 경로에서도 /v1/audio/speech 주소가 같다는 것만으로 연결 가능성을 확정하지 않습니다. 모델 지정 여부, 인증 헤더, 확장 필드 허용 여부, PCM 샘플레이트와 실제 응답 조각 형식을 확인해야 합니다. 현재 omnitts 동작과 제약은 기존 엔진 상세 설명에 있습니다.