arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3380 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3380 篇

2602.19117 2026-02-25 cs.CV 78%

Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models

保持符号投影布局:用于视觉-语言模型中以物体为中心的空间推理的符号投影布局

Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SymPL通过将以物体为中心的空间推理转化为符号布局形式,提升视觉-语言模型在多视角场景下的推理性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 78%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 78%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14119 2026-02-17 cs.CV 78%

GeoFusionLRM: Geometry-Aware Self-Correction for Consistent 3D Reconstruction

GeoFusionLRM: 基于几何的自我校正以实现一致的3D重建

Ahmet Burak Yildirim, Tuna Saygin, Duygu Ceylan, Aysegul Dundar

机构 * Bilkent University(比尔肯特大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :self-correction(title,abstract)

AI总结 GeoFusionLRM通过反馈几何信息提升单图像3D重建的几何精度与一致性

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04333 2026-02-10 cs.CV cs.RO 78%

RAP: 3D Rasterization Augmented End-to-End Planning

RAP: 3D 像素化增强端到端规划

Lan Feng, Yang Gao, Eloi Zablocki, Quanyi Li, Wuyang Li, Sichao Liu, Matthieu Cord, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院) Sorbonne Université(索邦大学)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 RAP通过3D像素化增强端到端规划,利用轻量级像素化和特征对齐实现可扩展的数据增强,提升闭环鲁棒性和长尾泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 78%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 78%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20272 2026-02-04 cs.CV 78%

Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning

Ground-R1: 通过强化学习激励基于地面的视觉推理

Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Ground-R1 通过 Scale Relative Policy Optimization 方法,解决 LVLM 在视觉证据 grounding 方面的偏差问题,提升推理准确性和证据 grounding 能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03210 2026-02-04 cs.CV 78%

VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers

VIRAL: 通过类比在扩散变换器中实现视觉上下文推理

Zhiwen Li, Zhongjie Duan, Jinyan Ye, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University, Shanghai, China(数据科学与工程学院,东华大学,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VIRAL通过类比和扩散变换器实现视觉上下文推理,解决视觉任务异质性问题,提升开放域编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19263 2026-02-04 cs.CV 78%

DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning

DWIM: 向工具感知的视觉推理迈进:通过差异感知的工作流生成与指令遮蔽微调

Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DWIM通过差异感知的工作流生成与指令遮蔽微调,提升工具感知的视觉推理性能。

Comments ICCV 2025

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02456 2026-02-03 cs.RO 78%

Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning

关系感知的层次3D场景图用于任务推理

Albert Gassol Puigjaner, Angelos Zacharia, Kostas Alexis

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 78%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 78%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18305 2026-01-28 cs.CV 78%

DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition

DiVE-k:基于微细图像识别的差分视觉推理

Raja Kumar, Arka Sadhu, Ram Nevatia

机构 * University of Southern California(南加州大学) Meta

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DiVE-k通过利用模型自身top-k预测作为训练信号,提升细粒度图像识别的差分推理能力,显著优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07695 2026-01-16 cs.CV 78%

Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model

平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力

Siwen Jiao, Tianxiong Lv, Kangan Qian, Chenxu Zhao, Xiuyuan Zhu, Tianlun Li, Xiaolong Cheng, Jinyu Li, Zhihao Liao, Yang Cai

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06461 2026-01-13 cs.CR cs.CV cs.ET 78%

VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference

VIPER Strike: 通过结构化视觉-语言推理击败视觉推理验证码

Minfeng Qi, Dongyang He, Qin Wang, Lefeng Zhang

机构 * City University of Macau(澳门城市大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ViPer通过结构化视觉-语言推理框架,有效解决视觉推理验证码问题,实现高达93.2%的成功率,优于现有方法,同时提出TSR策略提升防御效果。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01984 2026-01-06 cs.CV 78%

Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation

基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理

Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research, Asia(微软亚洲研究院) Tsinghua University(清华大学) University of Toronto(多伦多大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV 78%

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 78%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 78%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 78%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 78%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16461 2025-12-19 cs.CV cs.RO 78%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 78%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14257 2025-12-17 cs.CV 78%

Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs

通过概率图增强视觉编程用于视觉推理

Wentao Wan, Kaiyu Wu, Qingyang Ma, Nan Kang, Yunjie Chen, Liang Lin, Keze Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10927 2025-12-12 cs.CV 78%

FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos

FoundationMotion: 自动标注与视频中空间运动的推理

Yulu Gan, Ligeng Zhu, Dandan Shan, Baifeng Shi, Hongxu Yin, Boris Ivanovic, Song Han, Trevor Darrell, Jitendra Malik, Marco Pavone, Boyi Li

机构 * MIT(麻省理工学院) NVIDIA(英伟达) UMich(密歇根大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。

Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09215 2025-12-11 cs.CV 78%

View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs

视图-图:通过场景图上的视觉-语言推理实现零样本3D视觉定位

Yuanyuan Liu, Haiyang Mei, Dongyang Zhan, Jiayue Zhao, Dongsheng Zhou, Bo Dong, Xin Yang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出视图-图方法,通过场景图上的视觉-语言推理实现零样本3D视觉定位,有效解决空间语义关系处理难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08860 2025-12-10 cs.CV 78%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 78%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 78%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏