arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2502.18042 2025-09-19 cs.CV cs.AI 70%

VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion

Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Li Auto Inc.(Li汽车公司) the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05578 2025-09-09 cs.AI cs.RO 70%

OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision

Ruixun Liu, Lingyu Kong, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究所) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02278 2025-09-03 cs.GR cs.AI cs.MM 70%

Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation

Zikai Huang, Yihan Zhou, Xuemiao Xu, Cheng Xu, Xiaofen Xing, Jing Qin, Shengfeng He

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) South China University of Technology(华南理工大学) Guangdong Engineering Center for Large Model and GenAI Technology(广东省大模型与生成式人工智能技术工程中心) Guangdong Provincial Key Lab of Computational Intelligence and Cyberspace Information(广东省计算智能与网络信息重点实验室) Centre for Smart Health, Hong Kong Polytechnic University(香港理工大学智能健康研究中心) CAS-Hong Kong Joint Laboratory for Multimodal Medical Molecular Imaging(中国科学院-香港联合多模态医学分子成像联合实验室) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab, Guangzhou, Guangdong, China(广州琶洲实验室) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息系统学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00210 2025-09-03 cs.CV cs.AI 70%

Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment

Jinzhou Tang, Jusheng zhang, Sidi Liu, Waikit Xiu, Qinhan Lv, Xiying Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16602 2025-08-26 cs.HC cs.AI 70%

An Embodied AR Navigation Agent: Integrating BIM with Retrieval-Augmented Generation for Language Guidance

Hsuan-Kung Yang, Tsu-Ching Hsiao, Ryoichiro Oka, Ryuya Nishino, Satoko Tofukuji, Norimasa Kobori

机构 * Woven by Toyota, Inc., Japan(丰田公司,日本)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 11 pages, 9 figures, accepted to IEEE ISMAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09839 2025-06-12 cs.CV cs.AI cs.RO 70%

OctoNav: Towards Generalist Embodied Navigation

Chen Gao, Liankai Jin, Xingyu Peng, Jiazhao Zhang, Yue Deng, Annan Li, He Wang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

Comments 31 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16498 2025-05-23 cs.RO cs.AI 70%

Human-like Semantic Navigation for Autonomous Driving using Knowledge Representation and Large Language Models

Augusto Luis Ballardini, Miguel Ángel Sotelo

机构 * Computer Engineering Department, University of Alcalá(阿尔卡拉大学计算机工程系)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 7 pages, 5 figures, submitted for IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09427 2025-05-16 cs.LG cs.RO 70%

SafePath: Conformal Prediction for Safe LLM-Based Autonomous Navigation

Achref Doula, Max Mühlhäuser, Alejandro Sanchez Guinea

机构 * Technical University of Darmstadt(德累斯顿技术大学) NTT Data(NTT数据)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15280 2025-04-29 cs.CV cs.CL 70%

Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs

Chun-Hsiao Yeh, Chenyu Wang, Shengbang Tong, Ta-Ying Cheng, Ruoyu Wang, Tianzhe Chu, Yuexiang Zhai, Yubei Chen, Shenghua Gao, Yi Ma

机构 * UC Berkeley(加州大学伯克利分校) TranscEngram NYU(纽约大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校) HKU(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Project page: https://danielchyeh.github.io/All-Angles-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02193 2025-03-12 cs.CV cs.AI 70%

LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models

Fan-Yun Sun, Weiyu Liu, Siyi Gu, Dylan Lim, Goutam Bhat, Federico Tombari, Manling Li, Nick Haber, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments CVPR 2025, project website: https://ai.stanford.edu/~sunfanyun/layoutvlm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14669 2025-02-26 cs.CL 70%

AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO

Alan Dao, Dinh Bach Vu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18733 2025-02-03 cs.RO cs.AI 70%

Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation

Yuelei Li, Ge Yan, Annabella Macaluso, Mazeyu Ji, Xueyan Zou, Xiaolong Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16698 2025-01-29 cs.CL cs.CV cs.RO 70%

3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow

Yueen Ma, Yuzheng Zhuang, Jianye Hao, Irwin King

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07035 2024-12-31 cs.CL cs.CV 70%

Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models

Yue Zhang, Ziqiao Ma, Jialu Li, Yanyuan Qiao, Zun Wang, Joyce Chai, Qi Wu, Mohit Bansal, Parisa Kordjamshidi

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Authors contributed equally to this work, and supervisors contributed equal advising to this work; GitHub repository: https://github.com/zhangyuejoslin/VLN-Survey-with-Foundation-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04168 2024-10-18 cs.AI 70%

Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions

Qingbin Zeng, Qinglong Yang, Shunan Dong, Heming Du, Liang Zheng, Fengli Xu, Yong Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02284 2024-10-04 cs.CL 70%

Correlation and Navigation in the Vocabulary Key Representation Space of Language Models

Letian Peng, Chenyang An, Jingbo Shang

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01105 2024-09-06 cs.LG cs.CV cs.RO 70%

A Survey for Foundation Models in Autonomous Driving

Haoxiang Gao, Zhongruo Wang, Yaqian Li, Kaiwen Long, Ming Yang, Yiqing Shen

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14185 2024-08-27 cs.AI cs.RO 70%

DynamicRouteGPT: A Real-Time Multi-Vehicle Dynamic Navigation Framework Based on Large Language Models

Ziai Zhou, Bin Zhou, Hao Liu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments This paper is 12 pages long and represents the initial draft, version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19221 2024-05-01 cs.CV cs.CL 70%

Transcrib3D: 3D Referring Expression Resolution through Large Language Models

Jiading Fang, Xiangshan Tan, Shengjie Lin, Igor Vasiljevic, Vitor Guizilini, Hongyuan Mei, Rares Ambrus, Gregory Shakhnarovich, Matthew R Walter

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

Comments CORLW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13800 2024-01-26 cs.RO cs.AI 70%

Multi-Object Navigation in real environments using hybrid policies

Assem Sadek, Guillaume Bono, Boris Chidlovskii, Atilla Baskurt, Christian Wolf

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07241 2023-10-24 cs.CV cs.AI cs.RO 70%

ConceptFusion: Open-set Multimodal 3D Mapping

Krishna Murthy Jatavallabhula, Alihusein Kuwajerwala, Qiao Gu, Mohd Omama, Tao Chen, Alaa Maalouf, Shuang Li, Ganesh Iyer, Soroush Saryazdi, Nikhil Keetha, Ayush Tewari, Joshua B. Tenenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, Antonio Torralba

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments RSS 2023. Project page: https://concept-fusion.github.io Explainer video: https://www.youtube.com/watch?v=rkXgws8fiDs Code: https://github.com/concept-fusion/concept-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03454 2021-03-08 cs.CV cs.AI 70%

Structured Scene Memory for Vision-Language Navigation

Hanqing Wang, Wenguan Wang, Wei Liang, Caiming Xiong, Jianbing Shen

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Accepted on CVPR2021; Implementation will be available at https://github.com/HanqingWangAI/SSM-VLN

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.01830 2018-06-29 cs.LG stat.ML 70%

Relational Deep Reinforcement Learning

Vinicius Zambaldi, David Raposo, Adam Santoro, Victor Bapst, Yujia Li, Igor Babuschkin, Karl Tuyls, David Reichert, Timothy Lillicrap, Edward Lockhart, Murray Shanahan, Victoria Langston, Razvan Pascanu, Matthew Botvinick, Oriol Vinyals, Peter Battaglia

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14507 2025-06-18 cs.RO 69%

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?

Nitesh Subedi, Adam Haroon, Shreyan Ganguly, Samuel T. K. Tetteh, Prajwal Koirala, Cody Fleming, Soumik Sarkar

专题命中 视觉空间推理 :planning(abstract,comments);reasoning(abstract)

Comments 6 figures, 2 tables, Accepted to Robotics: Science and Systems (RSS) 2025 Workshop on Robot Planning in the Era of Foundation Models (FM4RoboPlan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17129 2026-08-19 cs.CV cs.RO 新提交 67%

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

PROBE:基于操作的视觉问答(使用VLM智能体)

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交 67%

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14160 2026-08-17 cs.RO 新提交 67%

OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器

Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

机构 * Changhong Intelligent Robot(长虹智能机器人) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。

Comments Technical report. 11 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 67%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 67%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 67%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏