יום ראשון, 4 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.AI ·

CodeMimicry: חדירה למודלי שפה גדולים על ידי תחביר קוד סטרוקטורי

CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion
חוקרים חדירים למודלי שפה גדולים על ידי תחביר קוד סטרוקטורי, ומצאו חולשה בבטיחות המודלים.
תקציר מקורי באנגליתarXiv:2609.39902v1 Announce Type: cross Abstract: Large language models have achieved remarkable capabilities across diverse domains, yet their safety alignment remains vulnerable to jailbreak attacks. In this work, we identify a previously underexplored failure mode - safety generalization lag - where alignment trained predominantly on natural language fails to transfer to the code domain. We show that this lag induces a code-completion blind spot, allowing malicious intent embedded within syntactically valid code to evade safety mechanisms. To exploit this vulnerability, we propose CodeMimicry, a fully automated black-box jailbreak framework that generates structured, object-oriented code prompts to induce harmful outputs via code completion. Experiments on 8 state-of-the-art commercial
קרא במקור המקורי