[ICLR'26] InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
multi-agent visual-search multi-hop-reasoning o3 thinking-with-images multimodal-benchmark map-vqa high-resolution-vision
-
Updated
Jul 28, 2026 - Jupyter Notebook