יום שני, 5 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.AI ·

טריינינג תאומי-מבקר: תפיסה-טווחי לקרדיט-פיצוי באמצע תרגילי השתלמות

$T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training
במאמר זה, המחברים מציגים טכניקה חדשה לטריינינג תאומי-מבקר, המאפשרת קרדיט-פיצוי תפיסה-טווחי באמצע תרגילי השתלמות. הטכניקה, הנקראת four{}, משתמשת בשני מבקרים, המספקים שני תיאורים של הקרדיט-פיצוי, המשולבים באמצעות משקלים התלויים באקציות. המחברים מציגים תאוריה של האופטימליות של המשקלים, ומציעים גבול עליון על הדריפט הנובע מהקרדיט-פיצוי. התוצאות המעשיות המוצגות במאמר זה תומכות בטענה שהטכניקה four{} משפרת את הביצועים הממוצעים של המדדים הבסיסיים ב-7.8%, ומקטינה את זמן ההכשרה הממוצע בעד 63.4%.
תקציר מקורי באנגליתarXiv:2609.32791v2 Announce Type: replace Abstract: Reinforcement mid-training lets language models learn internal thoughts from unlabeled text, but efficient token-level credit assignment remains challenging. Existing group-relative methods require costly repeated generation. Learned critics offer single-rollout feedback, but accurate return prediction alone does not ensure reliable policy updates. Our analysis shows how training--inference mismatch and PPO clipping prevent a common offset in advantage estimates from cancelling out, introducing additional update drift. We propose \tfour{}, a twin-critic method that calibrates token-level advantages from a single generated trajectory. After warmup and held-out qualification, the critics provide two advantage estimates, combined using actio
קרא במקור המקורי