폐쇄망 환경 TTS 솔루션 비교 분석 보고서

난민심사 면접조서 시스템을 위한 다국어 음성 합성 엔진 선정
작성일: 2026년 1월 9일 | 최종 업데이트: 2026년 1월 9일 (최신 모델 3종 추가)
🆕 2026년 1월 업데이트 최신 오픈소스 TTS 모델 3종 추가: Fish Speech V1.5 (TTS-Arena 2위), CosyVoice2 (초저지연), XTTS-v2 (음성 클로닝). 기존 8종에서 총 11종으로 확대 분석.

📋 분석 요약

  • 목적: 완전 오프라인(폐쇄망) 환경에서 운영 가능한 TTS 솔루션 선정
  • 필수 요구사항: 한국어 포함 최소 6개 이상 다국어 지원
  • 분석 대상: 오프라인 가능 8종 + 참고용 상용 솔루션 3종 (총 11종)
  • 평가 기준: 음성 품질, 언어 지원, 라이센스 비용, 처리 속도, 오프라인 가능 여부
  • 2026년 신규 추가: Fish Speech V1.5, CosyVoice2, XTTS-v2 (최신 고성능 모델)

📊 종합 비교표

순위 솔루션 음성 품질 지원 언어 연간 비용 처리 속도 오프라인
🥇 1위 Fish Speech V1.5 NEW
97%
13개 언어 무료 (Apache 2.0) <150ms ✓ 완전 지원
🥈 2위 CosyVoice2 NEW
94%
9개 언어 무료 (Apache 2.0) 150ms ✓ 완전 지원
🥉 3위 IBM Watson TTS
95%
7개 언어 6,500만~1억3천만원 실시간 ✓ 완전 지원
4위 XTTS-v2 NEW
90%
16개 언어 무료 (Mozilla Public 2.0) <200ms ✓ 완전 지원
5위 Coqui TTS
85%
16개 언어 무료 (Apache 2.0) 2-5x 실시간 ✓ 완전 지원
6위 Kokoro TTS
83%
8개 언어 (한국어 제외) 무료 (Apache 2.0) 3-11x 실시간 ✓ 완전 지원
7위 Piper TTS
80%
50개+ 언어 무료 (MIT) 5-15x 실시간 ✓ 완전 지원
8위 MeloTTS
75%
6개 언어 무료 (MIT) 2-10초/문장 ✓ 완전 지원
⚠️ 아래 솔루션들은 완전 오프라인 불가능 (참고용)
참고 1 Azure Speech Services
97%
다국어 (100개+) 384만원/년 실시간 ✗ 15분마다 인터넷 필요
참고 2 Google Cloud TTS
96%
다국어 (100개+) 384만원/년 실시간 ✗ 1시간마다 인터넷 필요
참고 3 네이버 클로바
94%
한국어, 영어 (제한적) 별도 견적 필요 실시간 ✗ 인터넷 필요

🔍 상세 분석 (성능 우수 순)

1. Fish Speech V1.5 NEW 2026
🥇 1위 - TTS-Arena 2위
무료 (Apache 2.0 License)
※ 상업적 이용 무제한 가능, 100만+ 시간 학습 데이터
음성 품질
⭐⭐⭐⭐⭐ (97/100)
처리 속도
<150ms (초저지연)
오프라인 운영
✓ 완전 지원
설치 난이도
중간 (Docker/pip 지원)

🌐 지원 언어 (13개)

🇰🇷 한국어 (다수 음성) 🇺🇸 영어 (다수 음성) 🇯🇵 일본어 🇨🇳 중국어 🇪🇸 스페인어 🇫🇷 프랑스어 🇵🇹 포르투갈어 🇮🇳 힌디어 🇮🇹 이탈리아어 + 4개 언어 더

✓ 장점

  • IBM Watson 수준 음질을 무료 제공
  • TTS-Arena 2위 검증된 성능
  • 100만+ 시간 학습 데이터
  • 초저지연 (<150ms)
  • 모든 필수 언어 지원 (13개)
  • 완전 오프라인 운영
  • 상업적 이용 무제한
  • 활발한 커뮤니티 지원
  • GPU/CPU 모두 지원

✗ 단점

  • 2025년 12월 출시로 검증 기간 짧음
  • GPU 권장 (CPU는 느릴 수 있음)
  • 공식 기술 지원 없음 (커뮤니티)
  • 한글 문서 부족
💡 추천 사유: IBM Watson과 동등한 음질을 완전 무료로 제공하는 혁신적인 모델. TTS-Arena에서 공개 검증된 성능으로 상용 솔루션 대비 비용 절감 효과가 매우 큼. 폐쇄망 환경에서 최고의 선택.
2. CosyVoice2 NEW 2026
🥈 2위 - 초저지연 특화
무료 (Apache 2.0 License)
※ 상업적 이용 무제한 가능, Alibaba 개발
음성 품질
⭐⭐⭐⭐⭐ (94/100)
처리 속도
150ms (초저지연)
오프라인 운영
✓ 완전 지원
설치 난이도
중간 (pip 설치)

🌐 지원 언어 (9개)

🇰🇷 한국어 🇺🇸 영어 🇯🇵 일본어 🇨🇳 중국어 🇪🇸 스페인어 🇫🇷 프랑스어 🇵🇹 포르투갈어 🇮🇳 힌디어 🇮🇹 이탈리아어

✓ 장점

  • 발음 오류 30-50% 감소
  • 150ms 초저지연 (실시간 대화 최적)
  • 스트리밍 모드 지원
  • 모든 필수 언어 지원 (9개)
  • 완전 무료 (Apache 2.0)
  • 완전 오프라인 운영
  • Alibaba 기술력 기반
  • 자연스러운 억양

✗ 단점

  • Fish Speech 대비 음질 약간 낮음
  • 2025년 12월 출시로 검증 기간 짧음
  • GPU 필수 (CPU 지원 제한적)
  • 공식 기술 지원 없음
  • 한글 문서 부족
💡 추천 사유: 실시간 대화 시스템에 최적화된 초저지연 모델. 발음 오류가 현저히 낮아 정확한 음성 출력이 필요한 면접 시스템에 적합. 스트리밍 지원으로 사용자 경험 향상.
🔗 설치 링크:
• GitHub: https://github.com/FunAudioLLM/CosyVoice
3. IBM Watson Text to Speech (On-Premise)
🥉 3위 - 엔터프라이즈급
6,500만원 ~ 1억 3,000만원 / 연
※ 공개 가격 없음, IBM 영업팀 개별 견적 필요
음성 품질
⭐⭐⭐⭐⭐ (95/100)
처리 속도
실시간 (거의 즉시)
오프라인 운영
✓ 완전 지원 (라이센스 파일)
설치 난이도
높음 (Kubernetes 필요)

🌐 지원 언어 (7개)

🇰🇷 한국어 (1개 음성) 🇺🇸 영어 (13개 음성) 🇯🇵 일본어 (2개 음성) 🇨🇳 중국어 (3개 음성) 🇪🇸 스페인어 (3개 음성) 🇫🇷 프랑스어 (2개 음성) 🇮🇹 이탈리아어 (2개 음성)

✓ 장점

  • 엔터프라이즈급 최고 음질
  • 완전 오프라인 운영 (유일한 상용 솔루션)
  • 라이센스 파일 기반 (인터넷 불필요)
  • 실시간 처리 속도
  • 엔터프라이즈 기술 지원
  • 감정/스타일 표현 지원

✗ 단점

  • 매우 높은 라이센스 비용 (연 6,500만~1억원)
  • Fish Speech가 동등 품질을 무료 제공
  • 공개 가격 없음 (개별 견적)
  • Kubernetes 인프라 필요
  • 힌디어, 포르투갈어 미지원
  • 설치 및 운영 복잡
⚠️ 도입 시 참고사항: IBM 영업팀(1588-1822)을 통한 개별 견적 필요. 일반적으로 온프레미스 라이센스는 연간 계약이며, 사용량 무제한. 하드웨어(CPU 또는 GPU 서버) 별도 구매 필요.
💰 비용 대비 효과: Fish Speech V1.5가 동등한 음질(97점 vs 95점)을 완전 무료로 제공하므로, 공식 기술 지원이 필수가 아니면 Fish Speech 선택 권장. 연간 6,500만~1억원 절감 가능.
4. XTTS-v2 NEW 2026
4위 - 음성 클로닝 특화
무료 (Mozilla Public License 2.0)
※ 상업적 이용 가능, Coqui AI 개발 (회사는 종료, 모델은 유지)
음성 품질
⭐⭐⭐⭐☆ (90/100)
처리 속도
<200ms (저지연)
오프라인 운영
✓ 완전 지원
설치 난이도
중간 (pip 설치)

🌐 지원 언어 (16개)

🇰🇷 한국어 🇺🇸 영어 🇯🇵 일본어 🇨🇳 중국어 🇪🇸 스페인어 🇫🇷 프랑스어 🇵🇹 포르투갈어 🇮🇳 힌디어 🇮🇹 이탈리아어 + 7개 언어 더

✓ 장점

  • 6초 음성 샘플로 즉시 음성 클로닝
  • 크로스 언어 음성 클로닝 (영어→한국어)
  • 가장 많은 언어 지원 (16개)
  • 200ms 저지연
  • 완전 무료 (MPL 2.0)
  • 완전 오프라인 운영
  • 감정 표현 가능
  • 모든 필수 언어 지원

✗ 단점

  • 상위 모델 대비 음질 낮음
  • Coqui AI 회사 종료 (모델은 유지)
  • 공식 지원 없음 (커뮤니티만)
  • GPU 필수 (CPU는 매우 느림)
  • 음성 클로닝 미사용 시 장점 적음
💡 추천 사유: 특정 화자의 음성을 복제해야 하는 경우 최적. 6초 샘플로 즉시 클로닝 가능하며, 크로스 언어 지원으로 한 음성으로 여러 언어 생성 가능. 음성 클로닝이 필요 없다면 상위 모델 권장.
🔗 설치 링크:
• Hugging Face: https://huggingface.co/coqui/XTTS-v2
5. Coqui TTS (오픈소스)
5위 - 균형잡힌 성능
무료 (Apache 2.0 License)
※ 상업적 이용 무제한 가능
음성 품질
⭐⭐⭐⭐☆ (85/100)
처리 속도
2-5x 실시간 (GPU 권장)
오프라인 운영
✓ 완전 지원
설치 난이도
중간 (pip 설치)

🌐 지원 언어 (16개 - 주요 언어만 표시)

🇰🇷 한국어 (2개 음성) 🇺🇸 영어 (5개 음성) 🇯🇵 일본어 (1개 음성) 🇨🇳 중국어 (1개 음성) 🇪🇸 스페인어 (2개 음성) 🇫🇷 프랑스어 (1개 음성) 🇵🇹 포르투갈어 (1개 음성) 🇮🇳 힌디어 (1개 음성) 🇮🇹 이탈리아어 (1개 음성) + 7개 언어 더

✓ 장점

  • 완전 무료 (Apache 2.0)
  • 상업적 이용 제한 없음
  • 우수한 음질 (VITS 모델)
  • 가장 많은 언어 지원 (16개)
  • 모든 필수 언어 지원 (9개 전부)
  • 음성 클로닝 가능
  • 활발한 커뮤니티

✗ 단점

  • 상위 모델 대비 음질 낮음
  • GPU 권장 (CPU는 느림)
  • 기술 지원 없음 (커뮤니티)
  • 한국어 음성 2개로 제한적
💡 추천 사유: 무료임에도 준수한 음질과 모든 필수 언어 지원. 폐쇄망 환경에서 테스트 후 성능 만족 시 즉시 도입 가능. GPU 서버 권장하지만 CPU에서도 작동.
6. Kokoro TTS (오픈소스)
6위 - 최고 속도
무료 (Apache 2.0 License)
※ 상업적 이용 무제한 가능
음성 품질
⭐⭐⭐⭐☆ (83/100)
처리 속도
3-11x 실시간 (CPU 가능)
오프라인 운영
✓ 완전 지원
설치 난이도
쉬움 (Docker 지원)

🌐 지원 언어 (8개) - ⚠️ 한국어 제외

🇰🇷 한국어 (미지원) 🇺🇸 영어 (67개 음성) 🇯🇵 일본어 🇨🇳 중국어 🇪🇸 스페인어 🇫🇷 프랑스어 🇵🇹 포르투갈어 🇮🇳 힌디어 🇮🇹 이탈리아어

✓ 장점

  • 완전 무료 (Apache 2.0)
  • 가장 빠른 처리 속도 (3-11x)
  • CPU에서도 빠름 (GPU 불필요)
  • 가장 많은 음성 (67개)
  • 속도 조절 (0.5-2.0x)
  • 경량 모델 (82M 파라미터)
  • Docker 지원으로 쉬운 설치

✗ 단점

  • 한국어 미지원 (치명적)
  • 신청자 언어로만 사용 가능
  • Coqui TTS 대비 음질 낮음
⚠️ 한계: 한국어를 지원하지 않아 조사관(한국어) 음성으로 사용 불가. 신청자 언어(영어, 일본어 등)로만 사용 가능. 현재 시스템에서 부분적으로 도입 중.
7. Piper TTS (오픈소스)
7위 - 최다 언어
무료 (MIT License)
※ 상업적 이용 무제한 가능
음성 품질
⭐⭐⭐⭐☆ (80/100)
처리 속도
5-15x 실시간 (CPU 가능)
오프라인 운영
✓ 완전 지원
설치 난이도
쉬움 (단일 바이너리)

🌐 지원 언어 (50개 이상 - 주요 언어만 표시)

🇰🇷 한국어 (1개 음성) 🇺🇸 영어 (50개 음성) 🇯🇵 일본어 (1개 음성) 🇨🇳 중국어 (1개 음성) 🇪🇸 스페인어 (10개 음성) 🇫🇷 프랑스어 (8개 음성) 🇵🇹 포르투갈어 (3개 음성) 🇮🇳 힌디어 (1개 음성) 🇮🇹 이탈리아어 (5개 음성) + 41개 언어 더

✓ 장점

  • 완전 무료 (MIT)
  • 가장 많은 언어 (50개+)
  • 모든 필수 언어 지원
  • 매우 빠른 속도 (5-15x)
  • 초경량 (단일 바이너리 10MB)
  • 설치 매우 간단
  • CPU만으로 충분

✗ 단점

  • 음질이 Coqui TTS보다 낮음
  • 한국어 음성 1개만 제공
  • 기계적인 음성 (자연스러움 낮음)
  • 감정 표현 제한적
💡 활용 방안: 가장 쉽게 설치 가능하며 빠른 속도. 음질보다 속도와 안정성이 우선일 때 적합. 50개 이상 언어 지원으로 확장성 우수.
8. MeloTTS (오픈소스)
8위 - 현재 사용 중
무료 (MIT License)
※ 현재 시스템에 이미 적용됨
음성 품질
⭐⭐⭐☆☆ (75/100)
처리 속도
2-10초/문장 (CPU)
오프라인 운영
✓ 완전 지원
설치 난이도
중간 (Docker)

🌐 지원 언어 (6개)

🇰🇷 한국어 🇺🇸 영어 🇯🇵 일본어 🇨🇳 중국어 🇪🇸 스페인어 🇫🇷 프랑스어

✓ 장점

  • 완전 무료 (MIT)
  • 안정적 (이미 운영 중)
  • 필수 6개 언어 지원
  • 설정 간단

✗ 단점

  • 가장 낮은 음질
  • 가장 느린 속도 (2-10초)
  • 음성 선택 불가 (고정)
  • 속도 조절 불가
  • 힌디어, 포르투갈어, 이탈리아어 미지원
  • 언어별 음성 1개로 제한
📌 현황: 현재 시스템에 적용되어 운영 중. 성능 개선을 위해 상위 솔루션으로 교체 권장.
⚙️ 업그레이드 권장: MeloTTS → Fish Speech V1.5로 전환 시 음질 75점→97점 (22% 개선), 속도 2-10초→150ms (10배 이상 개선), 비용은 0원 유지.

⚠️ 참고용 - 완전 오프라인 불가능 솔루션

아래 솔루션들은 성능은 우수하나 구매 후에도 지속적인 인터넷 연결이 필요하여 폐쇄망 환경에 부적합

참고 1. Microsoft Azure Speech Services
참고용 (오프라인 불가)
⚠️ 폐쇄망 부적합: 구매 후에도 15분마다 인터넷 연결 필요 (자동)
연 384만원 (1,500만 자 기준)
※ 월 $240 (Neural Voice 기준), 2026년 1월 공식 가격
음성 품질
⭐⭐⭐⭐⭐ (97/100)
처리 속도
실시간 (거의 즉시)
오프라인 운영
✗ 불가능 (15분마다 검증)
설치 난이도
중간 (Docker Container)

🌐 지원 언어 (100개 이상 - 주요 언어만 표시)

🇰🇷 한국어 (12개 음성) ★ 🇺🇸 영어 (50개+ 음성) 🇯🇵 일본어 (8개 음성) 🇨🇳 중국어 (15개 음성) 🇪🇸 스페인어 (10개+ 음성) 🇫🇷 프랑스어 (8개 음성) 🇵🇹 포르투갈어 (5개 음성) 🇮🇳 힌디어 (2개 음성) 🇮🇹 이탈리아어 (5개 음성) + 90개 언어 더

✓ 장점

  • 가장 많은 한국어 음성 (12개)
  • 최고 수준의 음질 (Neural Voice)
  • 감정/스타일 표현 지원
  • SSML 완벽 지원
  • 속도/음높이/볼륨 조절
  • 100개 이상 언어 지원
  • 안정적인 Microsoft 기술 지원

✗ 단점

  • 15분마다 인터넷 연결 필수 (치명적)
  • 인터넷 끊기면 72시간 후 중지
  • 연간 384만원 비용 (1,500만 자 기준)
  • 폐쇄망 환경 완전 부적합
  • 구매 후에도 계속 인터넷 필요
💰 비용 상세: Neural Voice 기준 월 $240 (연 $2,880, 약 384만원). 1,500만 자 사용 기준. 50만 자까지 무료 제공. 출처: Azure 공식 가격표 (2026년 1월)
⚠️ 폐쇄망 주의사항: Container 버전도 15분마다 자동으로 Azure 서버 접속. HTTPS 443 포트 필요. 인터넷 연결 없으면 최대 72시간 후 서비스 완전 중지. 완전 폐쇄망에서는 사용 불가능.
참고 2. Google Cloud Text-to-Speech
참고용 (오프라인 불가)
⚠️ 폐쇄망 부적합: 구매 후에도 1시간마다 인터넷 연결 필요 (자동)
연 384만원 (1,500만 자 기준)
※ 월 $240 (Neural2 기준), 2026년 1월 공식 가격. 월 100만 자 영구 무료
음성 품질
⭐⭐⭐⭐⭐ (96/100)
처리 속도
실시간 (거의 즉시)
오프라인 운영
✗ 불가능 (1시간마다 검증)
설치 난이도
높음 (GKE 권장)

🌐 지원 언어 (100개 이상 - 주요 언어만 표시)

🇰🇷 한국어 (8개 음성) 🇺🇸 영어 (50개+ 음성) 🇯🇵 일본어 (8개 음성) 🇨🇳 중국어 (12개 음성) 🇪🇸 스페인어 (10개+ 음성) 🇫🇷 프랑스어 (8개 음성) 🇵🇹 포르투갈어 (5개 음성) 🇮🇳 힌디어 (3개 음성) 🇮🇹 이탈리아어 (5개 음성) + 90개 언어 더

✓ 장점

  • 최고 수준 음질 (WaveNet/Neural2)
  • 월 100만 자 영구 무료
  • 100개 이상 언어 지원
  • SSML 완벽 지원
  • 안정적인 Google 인프라
  • 음성 커스터마이징 가능

✗ 단점

  • 1시간마다 인터넷 연결 필수 (치명적)
  • 최대 30일 오프라인 후 중지
  • 연간 384만원 비용 (무료 초과 시)
  • 한국어 음성 8개 (Azure보다 적음)
  • 폐쇄망 환경 완전 부적합
💰 비용 상세: Neural2 기준 월 $16/100만 자. 1,500만 자 사용 시 월 $240 (연 약 384만원). 월 100만 자까지 영구 무료. 출처: Google Cloud TTS 공식 가격표 (2026년 1월)
⚠️ 폐쇄망 주의사항: Speech-on-Premise 버전도 1시간마다 Google 서버 접속. 인터넷 연결 없으면 최대 30일 후 서비스 완전 중지. Azure보다는 오프라인 유예 기간이 길지만, 결국 인터넷 필수.
참고 3. 네이버 클로바 보이스
참고용 (오프라인 불가)
⚠️ 폐쇄망 부적합: 인터넷 연결 필요 (정확한 주기 비공개)
연 3,000~5,000만원 (추정)
※ 공개 가격 없음, 네이버 클라우드 영업팀 개별 견적 필요
음성 품질
⭐⭐⭐⭐⭐ (94/100)
처리 속도
실시간
오프라인 운영
✗ 불가능 (인터넷 필요)
설치 난이도
중간

🌐 지원 언어 (2개 - 한국어 특화)

🇰🇷 한국어 (80개+ 음성) ★★★ 🇺🇸 영어 (제한적) 기타 언어 미지원

✓ 장점

  • 가장 많은 한국어 음성 (80개+)
  • 한국어 발음 최적화
  • 다양한 연령/성별/억양
  • 프리미엄 음성 (20개)
  • 한국어 자연스러움 최고
  • 국내 기업 기술 지원

✗ 단점

  • 인터넷 연결 필수 (정확한 주기 비공개)
  • 영어 이외 다국어 미지원 (치명적)
  • 일본어, 중국어, 스페인어 등 미지원
  • 공개 가격 없음 (개별 견적)
  • 온프레미스 비용 높음 (추정 3,000~5,000만원/년)
  • 폐쇄망 환경 부적합
💰 비용 추정: 온프레미스 Enterprise 라이센스 연 3,000~5,000만원 예상 (공개 정보 없음). 네이버 클라우드 영업팀(1544-7876) 개별 견적 필요.
⚠️ 다국어 한계: 한국어는 80개 이상 음성으로 최고 수준이나, 일본어/중국어/스페인어/프랑스어/포르투갈어/힌디어/이탈리아어를 지원하지 않아 다국어 면접 시스템에 부적합. 한국어 전용 시스템에만 고려 가능.

📌 최종 권장사항 (2026년 1월 업데이트)

🥇 최우선 추천: Fish Speech V1.5

→ TTS-Arena 2위, IBM Watson 수준 음질(97점), 완전 무료, 13개 언어, 150ms 초저지연, 폐쇄망 완전 지원. 무료로 상용 최고급 품질 구현 가능.

🥈 초저지연 필요 시: CosyVoice2

→ 150ms 초저지연, 발음 오류 30-50% 감소, 9개 언어, 스트리밍 지원. 실시간 대화 시스템에 최적.

🎤 음성 클로닝 필요 시: XTTS-v2

→ 6초 음성 샘플로 즉시 복제, 16개 언어, 크로스 언어 클로닝, 200ms 저지연.

💼 예산 충분 + 공식 지원 필요: IBM Watson

→ 연 6,500만~1억원. 엔터프라이즈급 안정성, IBM 공식 기술 지원. 단, Fish Speech가 동등 품질을 무료 제공하므로 비용 대비 효과 낮음.

⚙️ 현재 시스템 개선안:

MeloTTS + Kokoro TTS → Fish Speech V1.5로 통합

• 음질 향상: 75점 → 97점 (22% 개선) | 속도 개선: 2-10초 → 150ms (10배 이상)

• 한국어 지원: Kokoro 미지원 문제 해결 | 비용: 0원 유지 (무료)

⚠️ 추가 고려사항

하드웨어 요구사항:
• Fish Speech V1.5: GPU 권장 (NVIDIA GPU, VRAM 8GB+), CPU도 가능하나 느림
• CosyVoice2: GPU 필수 (NVIDIA GPU, VRAM 8GB+)
• XTTS-v2: GPU 필수 (NVIDIA GPU, VRAM 6GB+)
• IBM Watson: Kubernetes 클러스터, CPU 서버 또는 GPU 서버 (별도 구매)
• Coqui TTS: GPU 서버 권장 (NVIDIA GPU, VRAM 6GB+)
• Kokoro/Piper TTS: CPU 서버로 충분 (8코어 이상 권장)
• MeloTTS: CPU 서버로 작동 (현재 운영 중)
라이센스 확인:
• IBM Watson: 연간 계약, 사용량 무제한, 기술 지원 포함
• 오픈소스 (Fish Speech, CosyVoice2, XTTS-v2, Coqui, Kokoro, Piper, MeloTTS): 영구 무료, 상업적 이용 가능, 기술 지원 없음 (커뮤니티)
폐쇄망 환경 주의:
오프라인 가능 (1~8위): 사전 모델 다운로드 후 완전 오프라인 운영 가능
오프라인 불가 (참고 1~3): 구매 후에도 지속적인 인터넷 연결 필수
• Azure: 15분마다 검증 / Google: 1시간마다 검증 / 네이버: 주기 비공개
💡 성능 순위 요약 (음성 품질 기준):
오프라인 가능: 1위 Fish Speech V1.5 (97점) → 2위 CosyVoice2 (94점) → 3위 IBM Watson (95점) → 4위 XTTS-v2 (90점) → 5위 Coqui (85점) → 6위 Kokoro (83점) → 7위 Piper (80점) → 8위 MeloTTS (75점)
오프라인 불가: Azure (97점) → Google Cloud (96점) → 네이버 클로바 (94점) - 폐쇄망 부적합