כתבה
arXiv cs.CL ·
אופטימיזציה של פוליציה עם קרדיט-אוגמנטציה חצי-סובקטיבית
Semifactual Credit-Augmented Policy Optimization
אופטימיזציה של פוליציה עם קרדיט-אוגמנטציה חצי-סובקטיבית לשיפור יכולות ההסברה של LLMs. המאמר עוסק בשיפור יכולות ההסברה של LLMs על ידי אופטימיזציה של פוליציה עם קרדיט-אוגמנטציה חצי-סובקטיבית. התוצאות המוצגות במאמר כוללות שיפור של 5.63% ו-4.17% בתחום המתמטיקה, בהתאמה, על ידי השיטה החדשה.
תקציר מקורי באנגליתarXiv:2609.40360v1 Announce Type: cross Abstract: Reinforcement learning with verifiable rewards (RLVR) has improved the reasoning capabilities of large language models (LLMs), yet their predictions remain sensitive to task-irrelevant prompt features. We investigate this sensitivity through semifactual prompt interventions that preserve the underlying problem and its answer. Our analysis reveals substantial variation in token-level sensitivity and shows that suppressing high-drift token candidates during decoding improves reasoning accuracy without updating model weights. These findings highlight a limitation of Group Relative Policy Optimization (GRPO), which assigns the same outcome-derived advantage to every response token and may reinforce potential spurious dependence alongside useful
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית