כתבה
arXiv cs.AI ·
כשלי בטיחות בהתאמה למצב בשיחות משולבות
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
במאמר זה, חוקרים חוקרים כשלי בטיחות בשיחות משולבות של מודלי שפה. הם מציגים כלי לבדיקת בטיחות של מודלי שפה, המסוגל לחקור את התנהגותם של המודלים בשיחות משולבות. המחברים מצאו כי מודלי שפה שנראו רובוסטים בבדיקות סטטיות, נכשלו במהירות ובאופן חוזר בשיחות משולבות.
תקציר מקורי באנגליתarXiv:2603.15684v2 Announce Type: replace-cross Abstract: Safety alignment in large language models is typically evaluated under isolated queries, yet real-world use is inherently multi-turn. Although multi-turn jailbreaks are empirically effective, the structure of conversational safety failure remains insufficiently understood. In this work, we study safety failures from a state-space perspective and show that many multi-turn safety failures in current safety-aligned language models arise from contextual state evolution, a regime that is not fully captured by isolated prompt-level analyses alone. We introduce STAR, a state-oriented diagnostic framework that treats dialogue history as a state transition operator and enables controlled analysis of safety behavior along interaction trajecto
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית