Spatial-Conditioned Reasoning in Long-Egocentric Videos
长时自体视频中的空间条件推理
机构 * Clemson University(克莱姆森大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
长时自体视频中的空间条件推理
机构 * Clemson University(克莱姆森大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。
多模态字体攻击在音频视觉推理中的系统研究
机构 * Boston University(波士顿大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。
A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理
机构 * Xidian University(西安电子科技大学) ; Sun Yat-sen University(中山大学) ; Qinghai Normal University(青海师范大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。
一种用于无训练代理推理的4D表示
机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) ; Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。
空间推理并非免费午餐:对LLaVA的受控研究
机构 * Cohere Labs Community(Cohere Labs社区) ; Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Imperial College London(伦敦帝国学院) ; Eisai Inc.(卫材公司) ; EleutherAI ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文通过LLaVA框架探讨了空间推理能力不足的原因,发现图像编码器设计和位置编码结构对空间理解有显著影响,但无法完全解决空间推理问题。
Comments Accepted as a poster at ICLR 2026 workshop ICBINB, typo fixed
CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理
机构 * Beihang University(北京航空航天大学) ; Westlake University(西湖大学) ; ByteDance Singapore(字节跳动新加坡) ; ByteDance China(字节跳动中国)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。
Comments CVPR 2026. Project page: https://codedance-vl.github.io/
VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Meituan, Inc.(美团) ; Beijing Normal University(北京师范大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。
从跨视图关系学习多视图空间推理
机构 * KAIST(韩国科学技术院) ; Config ; Hanyang University(汉阳大学) ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。
Comments Accepted to CVPR 2026
SPREAD:通过几何感知扩散进行空间-物理推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。
HandVQA: 评估视觉-语言模型中手部精细空间推理的诊断与改进
机构 * UNIST(蔚山科学技术院) ; University of Aberdeen(阿伯丁大学) ; University College London(伦敦大学学院) ; Fogsphere (Redev.AI Ltd), UK(Fogsphere (Redev.AI Ltd),英国)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 HandVQA通过视觉问答评估VLM对手部解剖的精细空间理解,发现现有模型在手部关节空间关系推理上的系统性缺陷,并通过3D数据训练提升模型在手部姿态识别和手-物交互任务中的性能。
Comments Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/
GeoReFormer:基于几何的车道线段检测与拓扑推理 refinement
机构 * University of California, Irvine(加州大学尔湾分校) ; Bosch North America(博世北美)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 GeoReFormer 提出一种统一的查询架构,通过嵌入几何和拓扑诱导偏差,提升车道线段检测和拓扑推理的精度与一致性,实现在 OpenLane-V2 上 34.5% 的 mAP 成绩。
Comments 8 pages, 6 figures
GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展
机构 * JIUTIAN Research(九天研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。
Comments accepted by CVPR 2026
Cog3DMap:基于3D认知地图的多视角视觉语言推理
机构 * POSTECH ; KAIST(韩国科学技术院) ; RLWRLD
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。
Comments Project Page: https://cog3dmap.github.io
智能下放:探索小型多模态模型中感知与推理的瓶颈
机构 * Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。
Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence
GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理
机构 * Case Western Reserve University(凯斯西储大学) ; Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。
Comments Project page at https://vulab-ai.github.io/GSMem/
P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航
机构 * HKUST(GZ)(香港科技大学(广州))
专题命中 视觉空间推理 :planning(title,abstract)
AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。
OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航
机构 * CertaintyX ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。
Context-Nav: 基于上下文的探索与视点感知的3D空间推理用于实例导航
机构 * Department of AI Convergence(人工智能融合系)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 Context-Nav通过上下文驱动的探索和视点感知的3D空间推理,提升实例导航任务的性能,无需特定任务训练,实现最先进的结果。
Comments Accepted to CVPR 2026. Code is available at https://github.com/AutoCompSysLab/ContextNav
视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆
机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) ; SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。
Comments Computer Vision
通过迭代证据细化提升视觉推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。
LatentGeo: 在潜在空间中学习可学习的辅助构造以进行多模态几何推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nankai University(南开大学) ; Communication University of China(中国传媒大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 LatentGeo通过学习潜在空间中的连续视觉表示,解决多模态几何推理中辅助构造的表示问题,采用三阶段课程和强化学习方法提升几何推理任务的性能。
GeoSense: 内化几何必要性感知以实现多模态推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 GeoSense通过内化几何必要性感知,提升多模态推理的鲁棒性和效率。
REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Peking University(北京大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。
Comments CVPR 2026 Accepted
RegionReasoner: 基于区域的多轮视觉推理
机构 * University of Amsterdam(阿姆斯特丹大学) ; Anhui University(安徽大学) ; Westlake University(西湖大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 RegionReasoner通过强化学习框架,结合接地保真度和全局-局部语义对齐,提升多轮视觉推理的准确性和一致性。
Comments Accepted by ICLR 2026
SGR3模型:三维场景图检索-推理模型
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Shenzhen University(深圳大学) ; Hunan University(湖南大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。
轻量级视觉推理用于社交感知机器人
机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。
Comments ICRA26
SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航
机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。
pySpatial: 为零样本空间推理生成3D视觉程序
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Pittsburgh(匹兹堡大学) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。
Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io
SSR:通过结构化场景推理推动空间智能的极限
机构 * Foundation Model Department, Huawei(华为基础模型部门)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SSR通过结构化场景推理框架,在减少对齐成本的同时,实现了高效的空间智能,优于更大规模模型。
动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠
机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。
Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation