כתבה
arXiv cs.CL ·
בדיקת ביצועים של כלים לזיהוי דיבור אוטומטי
Benchmarking Automatic Speech Recognition Tools for Iberian Languages
המחקר בוחן את ביצועיהם של 11 כלים לזיהוי דיבור אוטומטי ב-5 שפות איבריות. התוצאות מראות כי אין מודל דומיננטי, וישנם פשרות בין דיוק, יעילות וכיסוי שפות. המחקר מדגיש את החשיבות של כיסוי הדרכה לשפות בעלות משאבים נמוכים.
תקציר מקורי באנגליתarXiv:2609.36920v1 Announce Type: new Abstract: Comprehensive evaluations of automatic speech recognition (ASR) for Iberian languages remain limited, and low-resource languages, biases, and efficiency trade-offs are underexplored. We benchmark eleven systems, ten open-weight models and one commercial API, across five Iberian languages (Basque, Catalan, Galician, Portuguese, Spanish), with German and Turkish as controls. Evaluation uses an 85-hour dataset covering read speech, broadcast media, and audiobooks, assessing accuracy and efficiency via word error rate (WER) and real-time factors (RTF/RTFx). Results show no single model dominates: accuracy, efficiency, and language coverage present clear trade-offs. Low-resource languages, especially Basque, degrade significantly, highlighting the
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית