arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-11 至 2026-02-11 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2602.09972 2026-02-11 cs.RO 82%

Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning

Hydra-Nav: 通过自适应双过程推理实现物体导航

Zixuan Wang, Huang Fang, Shaoan Wang, Yuanfei Luo, Heng Dong, Wei Li, Yiming Gan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17653 2026-02-11 cs.AI 79%

GeoGramBench: Benchmarking the Geometric Program Reasoning in Modern LLMs

GeoGramBench: 评估现代大语言模型中的几何程序推理

Shixian Luo, Zezhou Zhu, Yu Yuan, Yuncheng Yang, Lianlei Shan, Yong Wu

机构 * Li Auto Inc.(利亚特公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoGramBench通过评估现代大语言模型在几何程序推理中的能力,揭示了其在空间推理任务中的显著不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 67%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO 67%

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09701 2026-02-11 cs.CV cs.AI 57%

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏