Supertone 크레딧 부족 → 로컬/대안 TTS 후보 리서치. 환경: RTX 3060 Laptop 6GB VRAM. 본 노트는 외부 후기·논문·커뮤니티 보고를 기반으로 한 데스크 리서치이며, 실제 오디오 검증은 미실시.

한 줄 결론 (잠정)

  • 1순위: GPT-SoVITS v2/v2Pro — 한국어 공식 지원 + 1분 fine-tune 클로닝 + 6GB 추론 가능
  • 2순위: Fish Speech — 30+ 언어, WER 메트릭 우수, 영문권 평이 좋음 (한국어 직접 검증 필요)
  • 비추천: Zonos·Sesame CSM (한국어 미지원), XTTS-v2 (Coqui 회사 폐쇄 + 영한 혼합 시 발음 뭉개짐)

후보 모델 비교

1. GPT-SoVITS (v3/v4) ⭐

항목내용
한국어 지원✅ v2 (2024-08)부터 공식 지원 — 영/중/일/한/광동
클로닝5초 zero-shot · 1분 few-shot fine-tune
라이선스MIT
VRAMv3 (407M)는 6GB에서 빠듯, v2/v2Pro는 여유
한국어 후기Reddit r/LocalLLaMA에서 v3 zero-shot 일본어 SOTA 평가, 한국어는 GitHub Issue 2595에서 v4 fine-tune loss 이상 보고 (튜닝 까다로움)
평가v3/v4 fine-tune은 평균 품질 음원에선 v1/v2/v2Pro보다 약함 — 한국어는 v2/v2Pro가 안전

다음 액션: 클로드(Eddie)·제이크(Leo) Supertone 출력 1분씩 추출 → GPT-SoVITS v2Pro로 zero-shot 클로닝 톤 매칭 테스트.

2. F5-TTS

항목내용
한국어 지원△ Cross-lingual zero-shot 가능 (한국어 fine-tune 데이터 없이도)
클로닝Zero-shot 음성 클로닝
한국어 후기다중화자 12시간 데이터로 fine-tune 시도 시 텍스트 못 읽는 케이스 보고. 단일화자 12시간 + character-level 토큰화로 개선
평가라이트 모델이라 quality ceiling 낮음

3. XTTS-v2 (Coqui) ⚠️

항목내용
한국어 지원✅ 공식 17개 언어 중 ko 포함
한국어 후기한국 블로거: 영어 섞이면 발음 뭉개짐, g2pk2 모듈 써도 부족
⚠️ 리스크2025-12 Coqui AI 회사 폐쇄 — 공식 유지보수 끊김 (오픈소스 코드는 살아있음)

4. Kokoro TTS

항목내용
한국어 지원✅ 다국어 지원, 네이티브 발음 검증 통과 평가
클로닝❌ 미지원 (사전 훈련 보이스만)
파라미터82M (매우 가벼움)
한계보이스 옵션 적음, 캐릭터성 약함

5. Fish Speech

항목내용
한국어 지원✅ 30+ 언어
클로닝10초 voice cloning
메트릭Seed-TTS Eval에서 최저 WER, Audio Turing Test 0.515 (경쟁 대비 24-33% 우위)
한국어 후기한국 커뮤니티 후기 적음 — 직접 검증 필요

6. MeloTTS (ko) / Orpheus-3B-ko

항목MeloTTSOrpheus-3B-ko
라이선스MITApache-2.0
추론CPU 실시간 가능양자화 모델
클로닝검증 부족
평가가볍고 빠름, 캐릭터성 약함커뮤니티 검증 부족

한국어 미지원 (제외)

  • Zonos (Zyphra): 영/일/중/프/독만 — 한국어 ❌
  • Sesame CSM: 한국어 미지원

채널 듀오에 매핑하는 시나리오

현재 보이스:

  • 클로드 = Supertone Eddie 39efcf380136480f3941b5 @ 1.2x
  • 제이크 = Supertone Jake 1e2c793641ef26e096a73a @ 1.05x

옵션 A — 풀 로컬 전환

  • GPT-SoVITS v2Pro로 두 보이스 1분 샘플 → zero-shot 클로닝
  • 장점: 크레딧 0, 무제한 생성
  • 단점: 톤 매칭 검증 필요, 감정 표현 제한 가능

옵션 B — 하이브리드

  • 핵심 듀오 대사: Supertone 유지
  • 짧은 멘트·내레이션·실험: 로컬 TTS
  • 장점: 품질 안정 + 크레딧 절약
  • 단점: 보이스 톤 차이 가능

옵션 C — 풀 로컬 + 다른 캐릭터

  • 채널 보이스를 처음부터 로컬 모델 기준으로 다시 캐스팅
  • 장점: 로컬 모델 강점 살림
  • 단점: 채널 정체성 변경 (시청자 재학습 필요)

출처


후속 작업

  • GPT-SoVITS v2Pro Windows 설치 및 6GB VRAM 추론 검증
  • 클로드(Eddie)·제이크(Jake) 1분 샘플 추출 → zero-shot 클로닝 테스트
  • 동일 대본으로 Supertone vs GPT-SoVITS A/B 비교 오디오 생성 → Jake 청취 평가
  • Fish Speech도 동일 절차로 2순위 검증
  • 결과에 따라 옵션 A/B/C 중 하나 채택