יום שני, 5 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.CL ·

Morpheus: טכנולוגיה חדשה לטקסטואליזציה והסתגלות לשפה הטורקית

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish
Morpheus היא טכנולוגיה חדשה לטקסטואליזציה והסתגלות לשפה הטורקית. היא משתמשת במודל עצמאי עם גבולות מורפמיים כדי ליצור טקסטואליזציה והסתגלות לשפה. המודל נבנה על ידי תוכנית דינמית פואסונית-בינומיאלית, שמסוגלת להפוך את הסבירות לגבולות המורפמיים לחברות מורפמיות. Morpheus נבחנה על ידי ניתוח חישובי והיא הציגה תוצאות טובות יותר מאשר טקסטואליזציות קיימות.
תקציר מקורי באנגליתarXiv:2606.18717v2 Announce Type: replace Abstract: Turkish is agglutinative: meaning is carried by morphemes, yet the subword tokenizers that drive modern language models split words by corpus statistics, fragmenting semantically loaded suffixes and -- in the case of WordPiece and rule-based analyzers -- failing to decode their output back to the original text. This paper presents \textbf{Morpheus}, a neural morpheme-boundary model for Turkish that is at once a lossless, morphology-aware tokenizer and a word-embedding producer. A differentiable Poisson-binomial dynamic program turns per-character boundary probabilities into soft morpheme memberships during training and exact segments at inference, with no string normalization, so $\mathrm{decode}(\mathrm{encode}(w)) = w$ holds by construc
קרא במקור המקורי