כתבה
arXiv cs.AI ·
PrefPI: הנחיית פריאטי להפניית פוליציות גנרטיביות להתנהגויות מחוץ לתפוקה
PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors
מאמר זה מציג פרקטיקה חדשה להנחיית פוליציות גנרטיביות של רובוטים, באמצעות ניסוח פריאטי. הפרקטיקה, הקרויה PrefPI, משתמשת בשיטת גידוע חדשה, המאפשרת הפניית פוליציות גנרטיביות להתנהגויות שלא נצפו תחת הפוליציה המקורית. המאמר מציג תוצאות ניסויים של הפרקטיקה, המראות כי היא מצליחה להפנות פוליציות גנרטיביות להתנהגויות שלא נצפו תחת הפוליציה המקורית.
תקציר מקורי באנגליתarXiv:2609.40165v1 Announce Type: cross Abstract: We present PrefPI (Preference-Guided Policy Iteration), an iterative framework for steering pretrained generative robot policies using only relative preferences over self-generated trajectories. Unlike prior preference-learning methods that primarily sharpen modes already represented by the policy, we study steering beyond the initial effective support, where desired behaviors are rarely or never observed under the initial policy. Our key idea is to formulate preference learning as preference-conditioned generative modeling: preferred trajectories define a conditional distribution, whose density ratio with the broader behavior prior provides an implicit preference signal amplified by classifier-free guidance (CFG). Repeating this preference
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית