
OCR
Document AI
多言語OCRベンチマーク:精度はHunyuanとQwen、スループットはPaddleがリード
8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。
Akash Verma
3 min
VoicePingからのお役立ち情報をお届けします

8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。

話者が重複しないホールドアウト評価を主結果とし、クリーン条件と900話者条件を補助検証に位置づけた、5モデルの多言語オープンセット話者識別ベンチマークです。

VoicePing Diarization v0.1 は、多言語の話者分離モデルです。42ファイルのベンチマークで NeMo、pyannoteAI precision-2、AssemblyAI、Deepgram と比較しました。

100件の英日翻訳データをGPT-5.5で評価し、DeepL、Sakana Translate、VoicePing MT v0.1、GPT-5 mini、Google翻訳、Qwen、Azure、Llamaを品質と観測レイテンシで比較しました。

京都で開催された JPCA 2026 のメインセミナーで、VoicePing が英語と日本語のリアルタイム双方向翻訳を提供。ライブ Q&A・パネルディスカッションも支援しました。

MedTech ROUND Pitch Day で、VoicePing が医療機器スタートアップの英語ピッチを日本語へリアルタイム翻訳。QRコード、会場スクリーン、医療機器向けの専門用語辞書で支援しました。