
Text to Speech
Emotional TTS
情感 TTS 基准测试:Qwen3-TTS、CosyVoice、IndexTTS-2、Fish Audio 与 VoxCPM 在日语和中文上的表现
面向日语和中文六种目标情绪,对五个情感文本转语音模型进行 SenseVoice、emotion2vec 锚点、CER、自然度、运行时间和试听样本评估。
Kai-Teh Tzeng-VoicePing
4 min
查看 VoicePing 的基准测试、研究方法、模型评估与产品研究。
27篇文章

面向日语和中文六种目标情绪,对五个情感文本转语音模型进行 SenseVoice、emotion2vec 锚点、CER、自然度、运行时间和试听样本评估。

开源跨平台移动端完全离线语音翻译应用,集成端侧 ASR(SenseVoice)、神经机器翻译和 TTS,支持 iOS 和 Android 系统音频捕获

英日双向语音翻译模型基准测试。将 Qwen3-ASR(1.7B 参数,最高质量)和 Distilled Whisper(756M,快 4 倍)与 OpenAI Whisper large-v3 及 Meta SeamlessM4T v2 进行比较。

涵盖 Kokoro、Piper、Matcha、Kitten 和 VITS 在内的 Android/iOS 端侧 18 个 TTS 模型综合基准测试

在 Android、iOS、macOS 和 Windows 上对 16 个端侧语音识别模型和 9 个推理引擎进行的综合基准测试

VoicePing 如何基于定制化 Whisper V2 模型,在单条 WebSocket 流中实现自动、低延迟的语言切换——双语模式的完整设计历程。