כתבה
arXiv cs.AI ·
יריבים אדפטיביים
Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
נושא המחקר הוא בדיקת אבטחת סוכנים מבוססי LLM. החוקרים הציגו בנך' מרק 21 תרחישים לבדיקת התקפות אדפטיביות. התוצאות הראו כי קיימת חשיפה להתקפות גם במצבים של יריבים חזקים.
תקציר מקורי באנגליתarXiv:2607.18063v2 Announce Type: replace-cross Abstract: LLM-based agents process external content, exposing them to prompt injection and multi-turn manipulation. We present a 21-scenario benchmark for adaptive cross-session attacks against fresh-session LLM defenders: an autonomous LLM attacker observes prior defender responses and pivots across rounds, while each defender response is evaluated as a fresh interaction. A controlled 3 x 3 attacker-defender matrix contains 945 battles. Restricting scoring to the first round yields 0-1% attack success rate (ASR); allowing 15 rounds yields 7.9-16.8%. Pooling three attacker LLMs uncovers 1.7-2.2 times as many unique successful inputs as the best single attacker, at three times the battle budget. Aggregate rates conceal opposing scenario-specif
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית