כתבה
arXiv cs.AI ·
MultihopSpatial: תשתית בקרת-מרחבית רב-קפיצה למודלי Vision-Language
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
תשתית חדשה לבקרת-מרחבית רב-קפיצה במודלי Vision-Language, כולל תשתית ללמידה וכלים לבדיקה.
תקציר מקורי באנגליתarXiv:2603.18892v2 Announce Type: replace-cross Abstract: Spatial reasoning is foundational for Vision-Language Models (VLMs), particularly when deployed as Vision-Language-Action (VLA) agents in physical environments. However, existing benchmarks predominantly focus on elementary, single-hop relations, neglecting the multi-hop compositional reasoning and precise visual grounding essential for real-world scenarios. To address this, we introduce MultihopSpatial, offering three key contributions: (1) A comprehensive benchmark designed for multi-hop and compositional spatial reasoning, featuring 1- to 3-hop complex queries across diverse spatial perspectives. (2) Acc@50IoU, a complementary metric that simultaneously evaluates reasoning and visual grounding by requiring both answer selection a
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית