כתבה
arXiv cs.LG ·
למידת גבולות לא ידועים ללא נתונים לא בטוחים באמצעות רגולריזציה של אופטימליות וקונטרפקטואלי
Learning Unknown Constraints without Unsafe Data via Optimality and Counterfactual Regularization
במאמר זה, המחברים מציגים פרקטיקה ללמידת גבולות לא ידועים ללא נתונים לא בטוחים. הם מציגים רגולריזציה של אופטימליות וקונטרפקטואלי שמאפשרת ללמוד גבולות לא ידועים מבלי לפגוע בבטיחות. הם מציגים דוגמאות של רגולריזציה של אופטימליות וקונטרפקטואלי בתחום של ניהול גבולות.
תקציר מקורי באנגליתarXiv:2610.09350v1 Announce Type: cross Abstract: Learning from demonstrations (LfD) provides a framework for inferring unknown constraints from locally optimal, constraint-satisfying expert behavior. Existing approaches largely fall into two paradigms, constrained inverse optimal control (CIOC) and inverse constrained reinforcement learning (ICRL). CIOC exploits optimality conditions such as the Karush--Kuhn--Tucker (KKT) conditions but typically assumes known dynamics and structured constraint representations. Meanwhile, ICRL accommodates complex unknown constraints and unknown transition dynamics but often requires extensive online exploration, during which unsafe constraint violations may occur. In this work, we introduce Counterfactual KKT (CF-KKT), a constraint learning framework tha
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית