יום רביעי, 7 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.AI ·

LSC-DPO: אופטימיזציה ישירה של קודקס עם ניהול של סיגמואיד

LSC-DPO: Learning-Signal-Controlled Direct Preference Optimization
אופטימיזציה ישירה של קודקס עם ניהול של סיגמואיד. המחקר עוסק בשיפור דינמי של אופטימיזציה ישירה של קודקס עם ניהול של סיגמואיד. התוצאות המוצגות במאמר כוללות תוצאות של AlpacaEval 2, MT-Bench, ו-Anthropic-HH.
תקציר מקורי באנגליתarXiv:2610.07592v1 Announce Type: new Abstract: Direct Preference Optimization (DPO) has become a standard reward-model-free approach for aligning language models with preference data. However, as the scaled preference margin grows during training, the logistic DPO loss becomes progressively less sensitive to further changes. We study DPO from a loss-level geometric perspective and identify the sigmoid factor as a learning signal that characterizes the local sensitivity of the objective. Based on this view, we propose Learning-Signal-Controlled Direct Preference Optimization (LSC-DPO), which dynamically regulates the learning signal near a target regime. A log-space analysis establishes conditions for stable tracking of the target learning-signal regime. Experiments on AlpacaEval 2, MT-Ben
קרא במקור המקורי