Supertone 크레딧 부족 → 로컬/대안 TTS 후보 리서치. 환경: RTX 3060 Laptop 6GB VRAM. 본 노트는 외부 후기·논문·커뮤니티 보고를 기반으로 한 데스크 리서치이며, 실제 오디오 검증은 미실시.
한 줄 결론 (잠정)
- 1순위: GPT-SoVITS v2/v2Pro — 한국어 공식 지원 + 1분 fine-tune 클로닝 + 6GB 추론 가능
- 2순위: Fish Speech — 30+ 언어, WER 메트릭 우수, 영문권 평이 좋음 (한국어 직접 검증 필요)
- 비추천: Zonos·Sesame CSM (한국어 미지원), XTTS-v2 (Coqui 회사 폐쇄 + 영한 혼합 시 발음 뭉개짐)
후보 모델 비교
1. GPT-SoVITS (v3/v4) ⭐
| 항목 | 내용 |
|---|---|
| 한국어 지원 | ✅ v2 (2024-08)부터 공식 지원 — 영/중/일/한/광동 |
| 클로닝 | 5초 zero-shot · 1분 few-shot fine-tune |
| 라이선스 | MIT |
| VRAM | v3 (407M)는 6GB에서 빠듯, v2/v2Pro는 여유 |
| 한국어 후기 | Reddit r/LocalLLaMA에서 v3 zero-shot 일본어 SOTA 평가, 한국어는 GitHub Issue 2595에서 v4 fine-tune loss 이상 보고 (튜닝 까다로움) |
| 평가 | v3/v4 fine-tune은 평균 품질 음원에선 v1/v2/v2Pro보다 약함 — 한국어는 v2/v2Pro가 안전 |
다음 액션: 클로드(Eddie)·제이크(Leo) Supertone 출력 1분씩 추출 → GPT-SoVITS v2Pro로 zero-shot 클로닝 톤 매칭 테스트.
2. F5-TTS
| 항목 | 내용 |
|---|---|
| 한국어 지원 | △ Cross-lingual zero-shot 가능 (한국어 fine-tune 데이터 없이도) |
| 클로닝 | Zero-shot 음성 클로닝 |
| 한국어 후기 | 다중화자 12시간 데이터로 fine-tune 시도 시 텍스트 못 읽는 케이스 보고. 단일화자 12시간 + character-level 토큰화로 개선 |
| 평가 | 라이트 모델이라 quality ceiling 낮음 |
3. XTTS-v2 (Coqui) ⚠️
| 항목 | 내용 |
|---|---|
| 한국어 지원 | ✅ 공식 17개 언어 중 ko 포함 |
| 한국어 후기 | 한국 블로거: 영어 섞이면 발음 뭉개짐, g2pk2 모듈 써도 부족 |
| ⚠️ 리스크 | 2025-12 Coqui AI 회사 폐쇄 — 공식 유지보수 끊김 (오픈소스 코드는 살아있음) |
4. Kokoro TTS
| 항목 | 내용 |
|---|---|
| 한국어 지원 | ✅ 다국어 지원, 네이티브 발음 검증 통과 평가 |
| 클로닝 | ❌ 미지원 (사전 훈련 보이스만) |
| 파라미터 | 82M (매우 가벼움) |
| 한계 | 보이스 옵션 적음, 캐릭터성 약함 |
5. Fish Speech
| 항목 | 내용 |
|---|---|
| 한국어 지원 | ✅ 30+ 언어 |
| 클로닝 | 10초 voice cloning |
| 메트릭 | Seed-TTS Eval에서 최저 WER, Audio Turing Test 0.515 (경쟁 대비 24-33% 우위) |
| 한국어 후기 | 한국 커뮤니티 후기 적음 — 직접 검증 필요 |
6. MeloTTS (ko) / Orpheus-3B-ko
| 항목 | MeloTTS | Orpheus-3B-ko |
|---|---|---|
| 라이선스 | MIT | Apache-2.0 |
| 추론 | CPU 실시간 가능 | 양자화 모델 |
| 클로닝 | ❌ | 검증 부족 |
| 평가 | 가볍고 빠름, 캐릭터성 약함 | 커뮤니티 검증 부족 |
한국어 미지원 (제외)
- Zonos (Zyphra): 영/일/중/프/독만 — 한국어 ❌
- Sesame CSM: 한국어 미지원
채널 듀오에 매핑하는 시나리오
현재 보이스:
- 클로드 = Supertone Eddie
39efcf380136480f3941b5@ 1.2x - 제이크 = Supertone Jake
1e2c793641ef26e096a73a@ 1.05x
옵션 A — 풀 로컬 전환
- GPT-SoVITS v2Pro로 두 보이스 1분 샘플 → zero-shot 클로닝
- 장점: 크레딧 0, 무제한 생성
- 단점: 톤 매칭 검증 필요, 감정 표현 제한 가능
옵션 B — 하이브리드
- 핵심 듀오 대사: Supertone 유지
- 짧은 멘트·내레이션·실험: 로컬 TTS
- 장점: 품질 안정 + 크레딧 절약
- 단점: 보이스 톤 차이 가능
옵션 C — 풀 로컬 + 다른 캐릭터
- 채널 보이스를 처음부터 로컬 모델 기준으로 다시 캐스팅
- 장점: 로컬 모델 강점 살림
- 단점: 채널 정체성 변경 (시청자 재학습 필요)
출처
- Awesome-Korean-TTS-Local — 한국어 로컬 TTS 큐레이션
- GPT-SoVITS GitHub
- GPT-SoVITS v3 Reddit (LocalLLaMA)
- Cross-Lingual F5-TTS 논문 리뷰
- XTTS-v2 한국어 사용기 (himion blog)
- Kokoro TTS 리뷰 (reviewnexa)
- Fish Speech 소개 (PyTorchKR)
- Best TTS Models 비교 (DigitalOcean)
- Zonos GitHub (Zyphra)
후속 작업
- GPT-SoVITS v2Pro Windows 설치 및 6GB VRAM 추론 검증
- 클로드(Eddie)·제이크(Jake) 1분 샘플 추출 → zero-shot 클로닝 테스트
- 동일 대본으로 Supertone vs GPT-SoVITS A/B 비교 오디오 생성 → Jake 청취 평가
- Fish Speech도 동일 절차로 2순위 검증
- 결과에 따라 옵션 A/B/C 중 하나 채택
