arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 7 篇

2512.12622 2025-12-16 cs.CV cs.RO 87%

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20164 2025-12-16 cs.CL 85%

Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction

通过视觉抽象思考:通过视觉抽象增强多模态推理

Dairu Liu, Ziyue Wang, Minyuan Ruan, Fuwen Luo, Chi Chen, Peng Li, Yang Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12395 2025-12-16 cs.CV 67%

ArtGen: Conditional Generative Modeling of Articulated Objects in Arbitrary Part-Level States

ArtGen: 条件生成建模任意部分级状态的关节物体

Haowen Wang, Xiaoping Yuan, Fugang Zhang, Rui Jian, Yuanwei Zhu, Xiuquan Qiao, Yakun Huang

机构 * Anhui University(安徽大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 ArtGen通过条件扩散框架生成任意部分级状态的关节3D物体,采用跨状态采样和思维链推理模块,提升运动学一致性与结构先验推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12822 2025-12-16 cs.CV cs.AI 57%

Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding

Lemon:一种统一且可扩展的3D多模态模型用于通用空间理解

Yongyuan Liang, Xiyao Wang, Yuanchen Ju, Jianwei Yang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Lemon提出一种统一的Transformer架构,通过联合处理3D点云块和语言标记,实现空间-语言融合,提升3D多模态模型的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 50%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 50%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18734 2025-12-16 cs.RO 50%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏