יום שישי, 9 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.CL ·

התאמת סיימנטיקס של כיתות אנגלית לבחירת נתוני הכשרה רב-לשוניים

Adapting English Quality Classifiers for Multilingual LLM Pretraining Data Selection
במאמר זה, המחברים חוקרים את האפשרות להתאמת סיימנטיקס של כיתות אנגלית לבחירת נתוני הכשרה רב-לשוניים. הם מציעים שיטה להתאמת סיימנטיקס של כיתות אנגלית לבחירת נתוני הכשרה רב-לשוניים, ומדגימים את יעילותה במספר ניסויים.
תקציר מקורי באנגליתarXiv:2610.11585v1 Announce Type: new Abstract: Recent advances in large language model (LLM) pretraining highlight the role of high-quality training data in improving performance. While model-based filtering has proven effective in selecting high-quality subsets from web-scale corpora, especially for high-resource languages, low-resource languages face challenges due to limited availability of annotated data. This work explores extending quality filtering to over 100 languages by proposing a multilingual adaptation approach that converts an existing English quality classifier into a multilingual variant. Our approach proposes training a small multi-layer perceptron on top of Transformer encoder-only model embeddings, using multilingual text as input and scores obtained from English classi
קרא במקור המקורי