arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2602.08339 2026-02-10 cs.AI cs.CV 88%

CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT

CoTZero:通过分层合成CoT实现无标注的人类级视觉推理

Chengyi Du, Yazhe Niu, Dazhong Shen, Luxin Xu

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) The College of Computer Science and Technology(计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.AI

AI总结 CoTZero通过双阶段数据合成和认知对齐训练,实现无标注的人类级视觉推理,提升模型的层次推理和泛化能力。

Comments 16 pages 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07082 2026-02-10 cs.CV cs.AI 83%

MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation

MosaicThinker: 通过迭代构建空间表示实现设备端具身AI的视觉空间推理

Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Pittsburgh(匹兹堡大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 MosaicThinker通过迭代构建空间表示,提升设备端具身AI在复杂跨帧空间推理任务中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11397 2026-02-10 cs.CV 82%

EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning

通过LLM赋能的视觉指令微调提升几何推理能力

Zhihao Li, Yao Du, Yang Liu, Yan Zhang, Yufang Liu, Mengdi Zhang, Xunliang Cai, Charles Ling, Boyu Wang

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(自动化系,清华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 EAGLE通过视觉增强框架提升几何推理能力,解决MLLMs在几何理解与视觉感知上的不足。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07555 2026-02-10 cs.CV cs.AI 79%

VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation

VISOR:基于语言驱动的对象导航的视觉空间对象推理

Francesco Taioli, Shiping Yang, Sonia Raychaudhuri, Marco Cristani, Unnat Jain, Angel X Chang

机构 * Polytechnic of Turin(都灵理工大学) Simon Fraser University(Simon Fraser大学) University of Verona(威尼斯大学) University of Reykjavik(雷克雅未克大学) University of California, Irvine(加州大学尔湾分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VISOR提出了一种紧凑的3B参数VLA智能体,通过显式图像基础推理实现人类般的具身推理,提升对象识别和动作选择的可解释性、泛化能力和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18845 2026-02-10 cs.AI 79%

UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model

UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航

Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04333 2026-02-10 cs.CV cs.RO 78%

RAP: 3D Rasterization Augmented End-to-End Planning

RAP: 3D 像素化增强端到端规划

Lan Feng, Yang Gao, Eloi Zablocki, Quanyi Li, Wuyang Li, Sichao Liu, Matthieu Cord, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院) Sorbonne Université(索邦大学)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 RAP通过3D像素化增强端到端规划,利用轻量级像素化和特征对齐实现可扩展的数据增强,提升闭环鲁棒性和长尾泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08241 2026-02-10 cs.AI cs.CV 77%

Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs

MLLMs真的能看见吗:在多模态大语言模型中强化视觉注意力

Siqu Ou, Tianrui Wan, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 SAYO通过强化学习框架引入区域级视觉注意力奖励,提升多模态大语言模型的视觉聚焦能力,从而在多种推理和感知任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09002 2026-02-10 cs.RO cs.AI 70%

From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

从障碍到礼仪:基于VLM引导路径选择的机器人社交导航

Zilin Fang, Anxing Xiao, David Hsu, Gim Hee Lee

机构 * School of Computing(计算机学院) Smart Systems Institute(智能系统研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19942 2026-02-10 cs.SE 67%

Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving

Prometheus:面向仓库级问题解决的长周期代码库导航

Yue Pan, Zimin Chen, Siyu Lu, Zhaoyang Chu, Xiang Li, Han Li, Yang Feng, Claire Le Goues, Federica Sarro, Martin Monperrus, He Ye

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 Prometheus通过统一知识图谱和增强内存引擎,实现长周期代码库导航,提升仓库级问题解决的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07061 2026-02-10 cs.LG cs.AI 62%

TACIT: Transformation-Aware Capturing of Implicit Thought

TACIT:面向隐式思维的变换感知捕捉

Daniel Nobrega

机构 * Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TACIT提出一种基于扩散的Transformer模型,通过像素空间中的校正流实现可解释的视觉推理,在迷宫求解中展示了隐式思维的同步涌现特性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 57%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07277 2026-02-10 cs.CV cs.LG 57%

Cross-View World Models

跨视角世界模型

Rishabh Sharma, Gijs Hogervorst, Wayne E. Mackey, David J. Heeger, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry(Simon计算物理化学中心) Center for Soft Matter Research, Department of Physics(软物质研究中心,物理系) Statespace Labs, Inc.(Statespace公司) Center for Neural Science, New York University(神经科学中心,纽约大学) Department of Psychology, New York University(心理学系,纽约大学) Courant Institute of Mathematical Sciences, New York University(Courant数学科学研究所,纽约大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出跨视角世界模型,通过多视角预测训练智能体在不同视角下进行规划,提升空间感知与多智能体协作能力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19191 2026-02-10 cs.CV 50%

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

像阅读文本一样理解图像:视觉-语言模型中的序列图像理解

Yueyan Li, Chenggong Zhao, Zeyuan Zang, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过序列化方法理解图像内容,揭示视觉-语言模型中对象识别与空间感知的机制,改进解码效率并增强空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08071 2026-02-10 cs.CV 50%

ViT-5: Vision Transformers for The Mid-2020s

ViT-5:2020年代中期的视觉变换器

Feng Wang, Sucheng Ren, Tiezheng Zhang, Predrag Neskovic, Anand Bhattad, Cihang Xie, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ViT-5通过改进组件和架构,提升了视觉变换器的性能和泛化能力,成为2020年代中期更优的视觉骨干网络。

Comments Code is available at https://github.com/wangf3014/ViT-5

详情

展开后加载摘要…

URL PDF HTML 收藏