יום ראשון, 4 באוקטובר 2026 LIVE
AI־INFO

כתבה arXiv cs.CL ·

Traverse: למידה של כאשר לזכור, לאתחול, ולשנות כיוון לחיפוש אינטרנטי באורך זמן

Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search
אגנטים לומדים לנהל את תהליך החיפוש באמצעות שלושה מצבים: Rubric, Answer, ו-Verify. האגנט מגדיר קריטריות לתשובה תקינה, חוקר תחת אלה, ואז מאמת בעצמו את התוצאה לפני שהוא מחליט האם להפסיק או להמשיך בחיפוש. האגנט נשאר גם עם כלי זיכרון שמאפשר ניהול פעיל של הזיכרון. הטכניקה החדשה של ניהול הזיכרון נלמדת באמצעות למידה עם פרסום, אך זה עלול לגרום להתקלפות זיכרון, ולכן נפתר עם רפרן פשוט שמלמד רק את החלק האחרון אחרי ניהול הזיכרון. המודל ה-35B הגיע ל-72.83 ב-BrowseComp, והצליח להשיג תוצאות טובות יותר ממודלים פתוחים דומים.
תקציר מקורי באנגליתarXiv:2609.37082v2 Announce Type: replace Abstract: Long-horizon information-seeking agents often accumulate noisy or misleading context, causing early mistakes to persist and making recovery increasingly difficult. We introduce an autonomous search harness in which the agent manages its own search process through three states: Rubric, Answer, and Verify. The agent first defines criteria for a valid answer, searches under these criteria, and then independently verifies the result before deciding whether to terminate or continue searching. It is further equipped with a Seal Memory tool that enables active context management. Training this behavior with reinforcement learning, however, can induce Seal Collapse, resulting in unstable training and preventing the agent from reliably learning wh
קרא במקור המקורי