יום שישי, 31 ביולי 2026 LIVE
AI־INFO

כתבה arXiv cs.LG ·

התאמה מהירה כאילוץ בטיחות ללמידת תגמול לא תחנתית

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning
חוקרים הציעו שיטה חדשה לבטיחות בלמידת תגמול לא תחנתית. הרעיון הוא להגדיר בטיחות במונחים של יכולת התאמה: מצבים עתידיים עלולים להיות לא בטוחים אם ההתאמה הנדרשת להישאר בטוחים עולה על יכולת ההתאמה של המערכת. השיטה משתמשת בייצוגי הקשר ותחזיות קצרות טווח להערכת הביקוש להתאמה והשוואתו עם יכולת ההתאמה של המערכת.
תקציר מקורי באנגליתarXiv:2607.21646v1 Announce Type: new Abstract: Ensuring safety in reinforcement learning under nonstationarity requires determining whether a learning system can safely adapt to forecasted environmental change within the required recovery horizon. Existing safe reinforcement learning methods typically assume stationary environments and do not explicitly consider adaptation speed as a safety concern. However, when environments evolve over time, delayed adaptation may result in transient unsafe behavior. This paper proposes adjustment speed as a safety constraint for nonstationary reinforcement learning. The central idea is to define safety in terms of adaptation feasibility: future states or regions may become unsafe when the adaptation required to remain safe exceeds the learning system's
קרא במקור המקורי