
Text to Speech
Emotional TTS
감성 TTS 벤치마크: 일본어와 중국어에서의 Qwen3-TTS, CosyVoice, IndexTTS-2, Fish Audio, VoxCPM
일본어와 중국어 감성 TTS 모델 5종을 여섯 가지 감정, SenseVoice, emotion2vec 앵커, CER, 자연스러움, 실행 속도, 청취 예시로 비교했습니다.
Kai-Teh Tzeng-VoicePing
6 min
VoicePing의 벤치마크, 연구 방법론, 모델 평가 및 제품 연구를 확인하세요.
27개의 글

일본어와 중국어 감성 TTS 모델 5종을 여섯 가지 감정, SenseVoice, emotion2vec 앵커, CER, 자연스러움, 실행 속도, 청취 예시로 비교했습니다.

완전 오프라인으로 동작하는 오픈소스 크로스 플랫폼 모바일 음성 번역 앱. 온디바이스 ASR(SenseVoice), 뉴럴 기계번역, TTS를 iOS/Android에서 시스템 오디오 캡처와 함께 구현

영일 양방향 음성 번역 모델 벤치마크. Qwen3-ASR(1.7B, 최고 품질)과 Distilled Whisper(756M, 4배 빠름)를 OpenAI Whisper large-v3 및 Meta SeamlessM4T v2와 비교 평가합니다.

Kokoro, Piper, Matcha, Kitten, VITS를 포함한 Android/iOS용 18개 온디바이스 TTS 모델 종합 벤치마크

Android, iOS, macOS, Windows에서 16개 온디바이스 음성인식 모델과 9개 추론 엔진에 대한 종합 벤치마크

VoicePing이 커스터마이징한 Whisper V2 모델을 활용하여 단일 WebSocket 스트림 내에서 자동·저지연 언어 전환을 구현한 바이링구얼 모드의 설계 과정을 소개합니다.