כתבה
arXiv cs.LG ·
CATCH: תשתית ניתוח נשלטת להתקפות פרסום של תגמולים ב-RL
CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL
CATCH היא תשתית שמאפשרת לחקור התקפות פרסום של תגמולים ב-RL. היא מספקת תשתית ניתוח נשלטת שמאפשרת לחקור התקפות פרסום של תגמולים ב-RL. CATCH מאפשרת לחקור התקפות פרסום של תגמולים ב-RL ולבדוק את יעילות שונות של תגמולים.
תקציר מקורי באנגליתarXiv:2609.39533v3 Announce Type: replace-cross Abstract: During reinforcement learning with verifiable rewards (RLVR), large language models (LLMs) can exploit loopholes in their environments to obtain high rewards without improving the intended capabilities, i.e., reward hacking. Despite its risks to training efficiency and safety, monitoring and mitigating reward hacking during training remain challenging, which is limited by a lack of testbeds that reproduce hacking and reliably identify it. We introduce CATCH, a controllable testbed for studying reward hacking in coding RL. CATCH deliberately exposes environmental loopholes and provides execution-based gold labels by comparing success under a vulnerable evaluator with task correctness under an independent audit. It also can control th
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית