
OCR
Document AI
多语言 OCR 基准测试:Hunyuan 与 Qwen 领先准确率,Paddle 领先吞吐量
在严格 GPU-only 条件下,用覆盖五种语言、六类文档的 900 页数据评估八个开源 OCR 系统,并比较 CER、延迟、吞吐量、VRAM、能耗、截断和结构化输出。
Akash Verma
4 min
VoicePing的见解、技巧和更新

在严格 GPU-only 条件下,用覆盖五种语言、六类文档的 900 页数据评估八个开源 OCR 系统,并比较 CER、延迟、吞吐量、VRAM、能耗、截断和结构化输出。

一项以身份分离的留出评估为主要证据,并以干净语音条件和900人图库作为辅助检验的五模型多语言开放集说话人识别基准。

VoicePing Diarization v0.1 是一个多语言说话人分离模型。本次在 42 个文件的基准中与 NeMo、pyannoteAI precision-2、AssemblyAI 和 Deepgram 进行比较。

使用100条英日翻译数据和GPT-5.5评审,对DeepL、Sakana Translate、VoicePing MT v0.1、GPT-5 mini、Google翻译、Qwen、Azure和Llama进行质量与观测延迟比较。

正式发布 VoicePing ASR Model V0.1——一款支持英语、日语、韩语、中文和越南语的多语言语音转文字模型。

在东京举行的 MedTech ROUND Pitch Day 上,VoicePing 为医疗器械初创企业路演提供实时英译日支持,配合二维码访问、会场屏幕显示和定制医疗器械术语词典。