
OCR
Document AI
다국어 OCR 벤치마크: 정확도는 Hunyuan·Qwen, 처리량은 Paddle이 선도
8개 오픈 OCR 시스템을 5개 언어와 6개 문서 유형으로 구성된 900페이지에서 엄격한 GPU 전용 조건으로 평가하고 CER, 지연 시간, 처리량, VRAM, 에너지, 출력 잘림, 구조화 출력을 비교합니다.
Akash Verma
10 min
26개의 글

8개 오픈 OCR 시스템을 5개 언어와 6개 문서 유형으로 구성된 900페이지에서 엄격한 GPU 전용 조건으로 평가하고 CER, 지연 시간, 처리량, VRAM, 에너지, 출력 잘림, 구조화 출력을 비교합니다.

신원 분리 홀드아웃 평가를 중심으로 클린 음성 조건과 900명 화자 조건을 보조 검증으로 제시하는 5개 모델 다국어 오픈셋 화자 식별 벤치마크입니다.

VoicePing Diarization v0.1은 다국어 화자 분리 모델입니다. 42개 파일 벤치마크에서 NeMo, pyannoteAI precision-2, AssemblyAI, Deepgram과 비교했습니다.

영어-일본어 100개 행을 GPT-5.5로 평가하여 DeepL, Sakana Translate, VoicePing MT v0.1, GPT-5 mini, Google Translate, Qwen, Azure, Llama의 품질과 관측 지연시간을 비교했습니다.

영어, 일본어, 한국어, 중국어, 베트남어를 지원하는 다국어 음성-텍스트 변환 모델, VoicePing ASR Model V0.1을 소개합니다.

일본어와 중국어 감성 TTS 모델 5종을 여섯 가지 감정, SenseVoice, emotion2vec 앵커, CER, 자연스러움, 실행 속도, 청취 예시로 비교했습니다.