כתבה
arXiv cs.LG ·
PS-PPO: שיטת פרפקס-סמפלינג PPO ל-RLHF
PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
שיטת RLHF חדשה, PS-PPO, המשתמשת בפרפקס-סמפלינג PPO, מציעה פתרון יעיל יותר ללמידה מסוג RLHF. השיטה משתמשת בפרפקס-סמפלינג PPO כדי לצמצם את העלויות של הלמידה, ומציעה תוצאות דומות לשיטות RLHF חזקות.
תקציר מקורי באנגליתarXiv:2606.29758v2 Announce Type: replace Abstract: Reinforcement Learning from Human Feedback (RLHF) for Large Language Models increasingly relies on critic-free methods as a practical alternative to actor--critic training. Despite their simplicity, existing critic-free approaches propagate a trajectory-level learning signal uniformly across all tokens in a trajectory. This requires full-trajectory policy updates for every rollout, leading to substantial optimization cost for long reasoning traces, even though intermediate prefixes often contain enough information to largely determine the final outcome. We propose Prefix-Sampling Proximal Policy Optimization (PS-PPO), a compute-efficient critic-free method for RLHF that exploits this temporal redundancy. PS-PPO introduces a prompt-conditi
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית