arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 18 篇

2603.00207 2026-03-03 cs.CV cs.AI 83%

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19661 2026-03-03 cs.CV 82%

CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

CodeV: 通过工具感知策略优化实现基于图像的代码推理

Xinhai Hou, Shaoyuan Xu, Manan Biyani, Moyan Li, Jia Liu, Todd C. Hollon, Bryan Wang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 CodeV通过工具感知策略优化提升视觉推理的忠实度,实现更高准确率和更可靠的工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV 82%

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18753 2026-03-03 cs.LG cs.AI 81%

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

HalluGuard: 解密数据驱动和推理驱动的LLM幻觉

Xinyue Zeng, Junhong Lin, Yujun Yan, Feng Guo, Liang Shi, Jun Wu, Dawei Zhou

机构 * CS Department Virginia Tech(弗吉尼亚理工学院计算机科学系) EECS Department MIT(麻省理工学院电子工程与计算机科学系) CS Department Dartmouth College(达特茅斯学院计算机科学系) Statistics Department Virginia Tech(弗吉尼亚理工学院统计学系) CS Department Michigan State University(密歇根州立大学计算机科学系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 HalluGuard通过统一理论框架和NTK评分方法,系统识别LLM中的数据驱动和推理驱动幻觉,实现高精度检测。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24385 2026-03-03 cs.CV cs.AI 79%

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应

Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory(湖北珞珈实验室) School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08806 2026-03-03 cs.AI cs.RO 79%

Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation

赋予具身体验智能体空间推理能力以实现视觉-语言导航

Qianqian Bai, Zhongpu Chen, Ling Luo, Huaming Du, Yuqian Lei, Ziyun Jiao

机构 * Southwestern University of Finance(西南财经大学) Department of Informatics,Universitat Hamburg, Hamburg, Germany(汉堡大学信息学院) University of Electronic Science(电子科技大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 BrainNav通过模仿生物认知功能,提升具身体验智能体的空间推理能力,实现更高效的视觉-语言导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25390 2026-03-03 cs.CV cs.AI 79%

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, Ding Zhao

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00905 2026-03-03 cs.CV 78%

pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning

pySpatial: 为零样本空间推理生成3D视觉程序

Zhanpeng Luo, Ce Zhang, Silong Yong, Cunxi Dai, Qianwei Wang, Haoxi Ran, Guanya Shi, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。

Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00409 2026-03-03 cs.CV 78%

SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning

SSR:通过结构化场景推理推动空间智能的极限

Yi Zhang, Youya Xia, Yong Wang, Meng Song, Xin Wu, Wenjun Wan, Bingbing Liu, AiXue Ye, Hongbo Zhang, Feng Wen

机构 * Foundation Model Department, Huawei(华为基础模型部门)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SSR通过结构化场景推理框架,在减少对齐成本的同时,实现了高效的空间智能,优于更大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 70%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 67%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract)

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01426 2026-03-03 cs.CL 57%

Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics

通过注意力动态理解LLMs中键值缓存压缩的物理原理

Samhruth Ananthanarayanan, Ayan Sengupta, Tanmoy Chakraborty

机构 * IIT Delhi, India(德里印度理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 通过分析LLMs中键值缓存压缩的物理机制,揭示了压缩对内部表示和语义可达性的影响,以及不同架构在路由动态上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11758 2026-03-03 q-bio.QM cs.AI 57%

Protein Structure Tokenization via Geometric Byte Pair Encoding

通过几何字对编码进行蛋白质结构分词

Michael Sun, Weize Yuan, Gang Liu, Wojciech Matusik, Marinka Zitnik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Harvard Medical School(哈佛医学院) Apple(苹果公司) Notre Dame(诺特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GeoBPE通过几何字对编码实现蛋白质结构分词,提供压缩、数据效率和泛化能力,支持多架构应用并增强功能解释性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02079 2026-03-03 cs.CV 50%

MMNavAgent: Multi-Magnification WSI Navigation Agent for Clinically Consistent Whole-Slide Analysis

MMNavAgent: 多倍率WSI导航代理用于临床一致的全滑片分析

Zhengyang Xu, Han Li, Jingsong Liu, Linrui Xie, Xun Ma, Xin You, Shihui Zu, Ayako Ito, Xinyu Hao, Hongming Xu, Shaohua Kevin Zhou, Nassir Navab, Peter J. Schüffler

机构 * Institute of Pathology, Technical University of Munich, Germany(慕尼黑技术大学病理研究所) Munich Data Science Institute (MDSI), Munich, Germany(慕尼黑数据科学研究所) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) Computer Aided Medical Procedures (CAMP), TU Munich, Munich, Germany(计算机辅助医疗程序(CAMP),慕尼黑技术大学) Dalian University of Technology(大连理工大学) Cancer Hospital of Dalian University of Technology, Shenyang(大连理工大学肿瘤医院) Department of Human Pathology, Juntendo University Graduate School of Medicine(立命大学医学研究生院人类病理部门) University of Science and Technology of China(中国科学技术大学) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) Northwest University of China(中国西北大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MMNavAgent通过多倍率交互建模和自适应倍率选择,提升全滑片图像诊断性能,实验显示AUC和BACC均有所提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01301 2026-03-03 cs.CV 50%

When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains

当RL帮助医疗VLMs时?解构视觉、SFT和RL增益

Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh, Natasha Sharan, Abhishek Moturu, Elham Dolatabadi, Babak Taati

机构 * University of Toronto, Canada(多伦多大学) Vector Institute, Canada(向量研究所) KITE Research Institute, University Health Network, Canada(KITE研究机构) York University, Canada(约克大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究通过解构视觉、SFT和RL增益,发现RL在模型已有支持时最有效,SFT扩展支持使RL有效,提出边界意识的配方并实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23166 2026-03-03 cs.CV 50%

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

AgentVista: 评估在超挑战性现实视觉场景中的多模态代理

Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

机构 * Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AgentVista 是一个评估多模态代理在超挑战性现实视觉场景中能力的基准,通过真实场景和复杂工具交互任务揭示现有模型在长时间多模态工具使用方面的不足。

Comments The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00507 2026-03-03 cs.RO 50%

Optimal-Horizon Social Robot Navigation in Heterogeneous Crowds

异质人群中的最优时间跨度社会机器人导航

Jiamin Shi, Haolin Zhang, Yuchen Yan, Shitao Chen, Jingmin Xin, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Nation Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于社会条件优化的机器人导航框架,通过时空Transformer和强化学习策略动态调整预测时间跨度,提升在异质人群中的导航效率与安全性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00443 2026-03-03 cs.CV 50%

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SesaHand: 通过语义和结构对齐可控生成增强3D手重建

Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Communication University of China(中国通信大学)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏