EasyARC: Evaluating Vision Language Models on True Visual Reasoning
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG
Comments CVPR2025 Workshop on Test-time Scaling for Computer Vision
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG
Comments CVPR2025 Workshop on Test-time Scaling for Computer Vision
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
机构 * HKUST(香港科技大学) ; Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Imperial College London(伦敦帝国理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
机构 * Department of Computer Science and Engineering Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学) ; Statistics, Islamic University, Bangladesh(统计学,伊斯兰大学,孟加拉国) ; Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
Comments ICML 2025 (Spotlight)
机构 * University of Maryland College Park(马里兰大学学院市) ; University of Sydney(悉尼大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
Journal ref Computer Vision and Pattern Recognition Conference (CVPR) 2025
专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
Journal ref 2015 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2015), pp. 2943-2950
推理的几何学:表示空间中的流动逻辑
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过几何框架分析LLM推理过程,揭示其在表示空间中的流动特性,并验证逻辑结构与语义的关系。
Comments ICLR 2026. Code: https://github.com/MasterZhou1/Reasoning-Flow
专题命中 视觉空间推理 :CoT(title,abstract);reasoning(abstract,comments)
Comments This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments The first two authors have contributed equally to this work. Accepted as regular paper at CVPR 2023 Workshop and Challenges for New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality (NFVLR)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to TACL 2017, code: https://github.com/jannerm/spatial-reasoning
GRIT: 教授大语言模型通过图像思考
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; UC Santa Barbara(加州大学圣芭芭拉分校) ; eBay
专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。
Journal ref NeurIPS 2025
ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。
Comments 10 pages, 7 figures
AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shandong University(山东大学)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)
AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。
Comments Accepted by ACM Multimedia 2026
TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%
Comments 10 pages, 5 figures, 7 tables
DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。
Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack
超越缩放:学习用于超高分辨率遥感的多工具视觉推理
机构 * National University of Defense Technology(国防科技大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
Trace:一种用于多领域视觉推理的分类法引导环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。
用于多步视觉推理的分层去噪
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北京航空航天大学) ; Fuzhou University(福州大学) ; Muka Robotics(木卡机器人)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。
AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。
IndustryNav:探索动态工业导航中具身智能体的空间推理
机构 * Michigan State University(密歇根州立大学) ; Independent Researcher(独立研究者) ; University of California, Irvine(加州大学尔湾分校) ; Ohio State University(俄亥俄州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of Pittsburgh(匹兹堡大学) ; University of Virginia(弗吉尼亚大学) ; Arizona State University(亚利桑那州立大学) ; Purdue University Northwest(普渡大学西北分校)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 针对视觉大语言模型在空间推理的挑战,提出IndustryNav基准,利用动态工业场景评估,给出零样本导航管道及安全指标,研究发现模型在路径规划等方面有缺陷,凸显向主动探索等任务发展的需求。
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。