
Text to Speech
Mandarin TTS
中国語TTSモデルは数字をどう読むか:音声クローン600サンプルのベンチマーク
Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。
VoicePing- Kai-Teh Tzeng
3 min
VoicePingからのお役立ち情報をお届けします

Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。

Sony Open Innovation Day 2026で、VoicePingが会場のメインスクリーンとQRコードでアクセスする参加者のスマートフォンに、リアルタイム日英字幕を届けた事例をご紹介します。

8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。

話者が重複しないホールドアウト評価を主結果とし、クリーン条件と900話者条件を補助検証に位置づけた、5モデルの多言語オープンセット話者識別ベンチマークです。

VoicePing Diarization v0.1 は、多言語の話者分離モデルです。42ファイルのベンチマークで NeMo、pyannoteAI precision-2、AssemblyAI、Deepgram と比較しました。

100件の英日翻訳データをGPT-5.5で評価し、DeepL、Sakana Translate、VoicePing MT v0.1、GPT-5 mini、Google翻訳、Qwen、Azure、Llamaを品質と観測レイテンシで比較しました。