
Text to Speech
Mandarin TTS
中文 TTS 模型如何朗读数字:600 个语音克隆样本基准测试
我们使用包含小数、标识符、货币、公式和科学单位的 600 个中文语音克隆样本,测试了 Fish Audio S2.1、CosyVoice3-RL、IndexTTS2 和 Qwen3-TTS Base。
VoicePing- Kai-Teh Tzeng
3 min
查看 VoicePing 的基准测试、研究方法、模型评估与产品研究。
27篇文章

我们使用包含小数、标识符、货币、公式和科学单位的 600 个中文语音克隆样本,测试了 Fish Audio S2.1、CosyVoice3-RL、IndexTTS2 和 Qwen3-TTS Base。

在严格 GPU-only 条件下,用覆盖五种语言、六类文档的 900 页数据评估八个开源 OCR 系统,并比较 CER、延迟、吞吐量、VRAM、能耗、截断和结构化输出。

一项以身份分离的留出评估为主要证据,并以干净语音条件和900人图库作为辅助检验的五模型多语言开放集说话人识别基准。

VoicePing Diarization v0.1 是一个多语言说话人分离模型。本次在 42 个文件的基准中与 NeMo、pyannoteAI precision-2、AssemblyAI 和 Deepgram 进行比较。

使用100条英日翻译数据和GPT-5.5评审,对DeepL、Sakana Translate、VoicePing MT v0.1、GPT-5 mini、Google翻译、Qwen、Azure和Llama进行质量与观测延迟比较。

正式发布 VoicePing ASR Model V0.1——一款支持英语、日语、韩语、中文和越南语的多语言语音转文字模型。