כתבה
arXiv cs.LG ·
אופטימיזציה רובוסטית של מדיניות
Robust Policy Optimization via Adversarial Importance Sampling
פותחה שיטה חדשה לאופטימיזציה רובוסטית של מדיניות ללמידת חיזוק עמוקה. השיטה, הנקראת Adversarial Importance Sampling, משתמשת בדגימה חשובה כדי להעריך ולאופטימיזציה של תשואות הגרועות ביותר. הקוד הוא זמין ב-GitHub.
תקציר מקורי באנגליתarXiv:2609.13044v1 Announce Type: new Abstract: Significant progress has been made in safeguarding deep reinforcement learning (DRL) policies against input perturbations. Developing robust DRL involves three main stages: algorithm design, implementation, and evaluation. In this work, we identify and address a key limitation at each stage. First, we introduce Adversarial Importance Sampling (Advis), a method that uses importance sampling over trajectories from standard training to estimate and optimize verifiable worst-case returns. Advis satisfies three desirable criteria not jointly achieved by prior work: it requires no additional environment interactions, no auxiliary networks, and captures long-term robustness. Second, we introduce advrl, a modular PyTorch library that provides clean,
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית