כתבה
arXiv cs.AI ·
BORA: גשר בין למידת תגובה רפלקסיבית חוצה-קו להתאמה חוזרת על-קו למודלי VLA דקסטרוס
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models
מערכת ללמידת תגובה רפלקסיבית חוצה-קו למודלי VLA דקסטרוס בעולם האמיתי. BORA משלב קריטיקה-מותאמת-פעולה לפוליצי VLA של יציבות ומשתמש בקריטיקה זו גם להתאמה חוזרת על-קו. BORA משלב טלאופרציה של זרוע-יד עם פוליצי מקומי שמתרגם אינטנט קוארס של האדם לתנועות פנג-מוטציות ספציפיות לגוף. BORA מעדכן רק פעילות רזיליאנט-פעולה קלה, ולא מעדכן את המודל המלא. BORA נבחן על שישה משימות בעולם האמיתי, והוא משפר את הצלחה הממוצעת מ-60.8% ל-82.5% על-גבי פריטים רגילים, ומ-52% ל-70% על-גבי פריטים שלא נלמדו.
תקציר מקורי באנגליתarXiv:2605.30226v3 Announce Type: replace-cross Abstract: Vision-Language-Action (VLA) policies provide strong behavioral priors for dexterous manipulation, yet adapting them on real robots remains challenging because high-DoF contact failures are difficult for humans to correct and online interaction is expensive. We present BORA, an offline-to-online reinforcement learning system that integrates an action-conditioned critic into a consistency-policy VLA and reuses the learned critic for frozen-base residual adaptation. To obtain executable corrective data, BORA combines wearable arm--hand teleoperation with a demonstration-guided local policy that translates coarse human intent into coordinated, embodiment-specific finger motions for contact-rich skills. Online robot rollouts and human c
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית