כתבה
arXiv cs.CL ·
PrivDrift: בדיקת הדלפה של מידע סודי בשיחות LLM
PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations
PrivDrift הוא כלי לבדיקת הדלפה של מידע סודי בשיחות LLM. הוא משמש לבדיקה האם מידע סודי שמשתמשים משתפים במהלך שיחה עם מודל LLM נשאר זמין לאחר שהשיחה עוברת לנושאים אחרים. הכלי כולל 1,000 שיחות מבוקרות עם מידע סודי, ומאפשר לבדוק את רמת ההדלפה של המידע הסודי.
תקציר מקורי באנגליתarXiv:2609.30094v2 Announce Type: replace-cross Abstract: Large language models increasingly operate as persistent assistants in user-facing, shared-session, and tool-augmented settings. When users disclose sensitive information during an active conversation, that information may remain behaviorally recoverable through later prompts even after the dialogue shifts to unrelated topics. We introduce PrivDrift, a benchmark for auditing whether user-disclosed secrets remain recoverable after conversational topic drift and persuasion-based probing. PrivDrift contains 1,000 controlled multi-turn dialogues with seeded secrets, content-dense drift turns, and standardized extraction probes. Across three LLMs with extended context windows, dialogue-level hybrid leakage remains substantial, ranging fr
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית