arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-30 至 2026-01-30 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 8 篇

2601.21821 2026-01-30 cs.CV 85%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 85%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21037 2026-01-30 cs.LG cs.AI cs.CL cs.CV 85%

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

基于框架的思考:视觉上下文和测试时扩展如何增强视频推理

Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) Hong Kong University of Science(香港科学大学) University of California San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。

Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 81%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04575 2026-01-30 cs.AI 79%

Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing

规模行为克隆提升因果推理:一个用于实时视频游戏播放的开放模型

Yuguang Yue, Irakli Salia, Samuel Hunt, Chris Green, Wenzhe Shi, Jonathan J Hunt

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种开放的训练方法,通过扩大模型和数据规模提升因果推理能力,展示了在实时视频游戏中的高性能表现。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22027 2026-01-30 cs.AI 57%

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty

CAR-bench: 评估在现实世界不确定性下LLM代理的一致性和限意识

Johannes Kirmayr, Lukas Stappen, Elisabeth André

机构 * BMW Group Research and Technology(宝马集团研究与技术) Augsburg University(艾希施泰特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CAR-bench旨在评估LLM代理在现实世界不确定性下的一致性、不确定性处理和能力意识,通过多轮对话和工具使用测试其可靠性和自我意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21751 2026-01-30 cs.CV 50%

Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation

动态拓扑感知:突破视觉语言导航中的粒度刚性

Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21506 2026-01-30 cs.RO cs.SY eess.SY 50%

IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation

IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构

Joonhee Lee, Hyunseung Shin, Jeonggil Ko

机构 * Yonsei University(延世大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。

详情

展开后加载摘要…

URL PDF HTML 收藏