יום שלישי, 15 בספטמבר 2026 LIVE
AI־INFO

כתבה arXiv cs.CL ·

עבר מעבר לתשובות בטוחות

Beyond Safe Answers: Segment-Aware Listwise Alignment for Reasoning Safety in Large Reasoning Models
SaLT-DPO הוא אלגוריתם חדש לשיפור ביטחון במודלים גדולים. הוא מטפל בבעיית הבטיחות בתשובות ובנימוקים. האלגוריתם משתמש בשיטות חדשות להערכת ביטחון ולשיפור התוצאות.
תקציר מקורי באנגליתarXiv:2609.15517v1 Announce Type: cross Abstract: Large Reasoning Models (LRMs) pose a dual-surface safety challenge: both intermediate reasoning traces and final answers can contain harmful content. Existing alignment methods often operate at the whole-response level, allowing unsafe reasoning to be masked by a safe-looking final answer. We propose Segment-aware Listwise Target DPO (SaLT-DPO), which addresses this gap through three mechanisms: (1) segment-aware listwise alignment that decomposes responses into reasoning and answer segments, independently scores each segment's safety, and aligns length-normalized segment rewards with soft target distributions over multiple candidates; (2) joint safety coherence regularization that applies a weakest-link principle to promote safety consiste
קרא במקור המקורי