Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks
专题命中 视觉空间推理 :reasoning(title,abstract)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Accepted to ICCV 2019 (Oral)
专题命中 视觉空间推理 :planning(title,abstract)
Comments 3 pages, 6 figures, IROS'13 Workshop on Robots and Sensors integration in future rescue INformation system (ROSIN'13)
空间记忆智能体:用于空间智能的基于经验的过程记忆
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI
AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。
Comments Under Review
空间智商:通过分层能力测试解构空间智能
机构 * NVIDIA Research(英伟达研究院) ; Yale University(耶鲁大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。
REST:基于零样本目标导航的视界探索Steiner树
机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。
Comments Accepted to IROS'26
WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型
机构 * Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。
Comments 20 pages, 7 figures
SMDD-Bench: 大语言模型能否解决真实世界的小分子药物设计任务?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stealth Pennsylvania State University(隐形宾夕法尼亚州立大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出SMDD-Bench基准,通过502个多轮长时任务实例评估LLM在真实小分子药物设计中的表现,发现最优模型GPT5.4仅解决40.2%任务。
BINDER: 基于开放词汇命令的即时自适应移动操作
机构 * Seoul National University(首尔国立大学) ; ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)
专题命中 视觉空间推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.AI
AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。
Comments 12 pages, 8 figures
无边界的长语音合成
机构 * MiLM Plus, Xiaomi Inc., China(小米公司MiLM Plus,中国) ; Nanjing University, China(南京大学,中国) ; WeNet Open Source Community(WeNet开源社区)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出无边界的长语音合成框架,通过统一能力集实现多说话人合成和长文本生成,采用全局-句子-token注释策略和连续分词器提升指令遵循能力,构建分层控制协议栈实现多模态输入到结构化生成命令的转换。
PhotoAgent:一种具有空间与审美理解的机器人摄影师
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026
GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型
机构 * Yeungnam University(延世大学) ; Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。
Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors
MLLMs真的能看见吗:在多模态大语言模型中强化视觉注意力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 SAYO通过强化学习框架引入区域级视觉注意力奖励,提升多模态大语言模型的视觉聚焦能力,从而在多种推理和感知任务中取得性能提升。
迈向多模态大语言模型的认知超感知
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。
无标签,无问题:利用多模态验证器训练视觉推理器
机构 * California Institute of Technology(加州理工学院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI
AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。
Comments Project webpage: https://glab-caltech.github.io/valor/
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * Integrated Program in Neuroscience (IPN) McGill University(神经科学联合计划 麦吉尔大学) ; Mila, University of Montreal(蒙特利尔大学Mila) ; Microsoft Research USA(微软研究院美国总部) ; Department of Physiology McGill University(生理学系 麦吉尔大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
Comments Paper accepted by nips 2025
机构 * College of Intelligence and Computing(智能与计算学院) ; Tianjin University(天津大学) ; Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居与智能技术重点实验室) ; Laboratory of Computation and Analytics of Complex Management Systems(复杂管理系统计算与分析实验室) ; School of Software(软件学院) ; Shandong University(山东大学) ; Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR)(SDU-NTU人工智能研究联合中心(C-FAIR)) ; Faculty of Environment, Science and Economy(环境、科学与经济学院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) ; DP Technology(DP技术公司) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Tongji University(同济大学) ; School of Integrated Innovation, Chulalongkorn University(朱拉隆功大学创新学院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments I withdraw arXiv:2503.10177 due to critical computational errors invalidating its conclusions and the withdrawal of consent from co-author Yanjun Chen
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL
Comments Accepted to NeurIPS 2024. Project and codes url: https://visualsketchpad.github.io/
关于视觉推理中的局部性和长度泛化
机构 * Qualcomm AI Research(高通人工智能研究中心)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。
Comments Accepted at ECCV 2026
RAVEN: 基于视觉-空间-时间记忆的长期推理与导航
机构 * Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉空间推理 :reasoning(title);分类 cs.CL、cs.AI
AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。
Comments Project website: https://ravenmem.github.io/
PhysInOne:一套视觉物理学习与推理系统
机构 * vLAR Group(vLAR 研究组) ; The Hong Kong Polytechnic University(香港理工大学) ; Syai Singapore(Syai 新加坡) ; Meta
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。
Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html
专题命中 视觉空间推理 :reasoning(title);分类 cs.CL、cs.LG
Comments 8 pages, 8 Figures, 2 Tables
专题命中 视觉空间推理 :self-correction(title);分类 cs.CL、cs.LG
Comments CVPR 2019 Oral, video demo: https://youtu.be/AD9TNohXoPA
具身导航器:指向、思考、记忆与对齐以实现高效导航
机构 * ZJU(浙江大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。
无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);self-correction(abstract)
AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。
在结构中思考:评估约束空间中的空间智能
机构 * Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)
AI总结 提出SSI-Bench基准,通过结构约束下的空间推理任务评估视觉语言模型的空间智能,发现模型与人类存在巨大差距。
Comments ICML 2026, Project Page: https://ssi-bench.github.io