arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2402.12289 2024-06-26 cs.CV 67%

DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models

Xiaoyu Tian, Junru Gu, Bailin Li, Yicheng Liu, Yang Wang, Zhiyong Zhao, Kun Zhan, Peng Jia, Xianpeng Lang, Hang Zhao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Project Page: https://tsinghua-mars-lab.github.io/DriveVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00449 2024-05-02 cs.LG cs.AI cs.CL cs.IR cs.NE 67%

RAG-based Explainable Prediction of Road Users Behaviors for Automated Driving using Knowledge Graphs and Large Language Models

Mohamed Manzour Hussien, Angie Nataly Melo, Augusto Luis Ballardini, Carlota Salinas Maldonado, Rubén Izquierdo, Miguel Ángel Sotelo

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19696 2024-05-01 cs.CV cs.AI cs.CL cs.LG 67%

Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners

Chun Feng, Joy Hsu, Weiyu Liu, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06405 2024-04-12 cs.AI cs.CG cs.CL cs.LG 67%

Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry

Shiven Sinha, Ameya Prabhu, Ponnurangam Kumaraguru, Siddharth Bhat, Matthias Bethge

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in Progress. Released for wider feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04242 2024-04-08 cs.CV cs.AI cs.CL cs.LG 67%

Physical Property Understanding from Language-Embedded Feature Fields

Albert J. Zhai, Yuan Shen, Emily Y. Chen, Gloria X. Wang, Xinlei Wang, Sheng Wang, Kaiyu Guan, Shenlong Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. Project page (with code): https://ajzhai.github.io/NeRF2Physics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15637 2024-03-26 cs.RO 67%

CoNVOI: Context-aware Navigation using Vision Language Models in Outdoor and Indoor Environments

Adarsh Jagan Sathyamoorthy, Kasun Weerakoon, Mohamed Elnoor, Anuj Zore, Brian Ichter, Fei Xia, Jie Tan, Wenhao Yu, Dinesh Manocha

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08244 2024-03-22 cs.RO 67%

Language and Sketching: An LLM-driven Interactive Multimodal Multitask Robot Navigation Framework

Weiqin Zu, Wenbin Song, Ruiqing Chen, Ze Guo, Fanglei Sun, Zheng Tian, Wei Pan, Jun Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01248 2024-03-05 cs.CV cs.AI cs.CL cs.LG 67%

SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code

Ziniu Hu, Ahmet Iscen, Aashi Jain, Thomas Kipf, Yisong Yue, David A. Ross, Cordelia Schmid, Alireza Fathi

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12728 2024-03-05 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering

Junnan Dong, Qinggang Zhang, Huachi Zhou, Daochen Zha, Pai Zheng, Xiao Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17793 2024-02-29 cs.AI cs.CL cs.LG 67%

A Surprising Failure? Multimodal LLMs and the NLVR Challenge

Anne Wu, Kianté Brantley, Yoav Artzi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15933 2024-02-27 cs.CV cs.AI cs.CL cs.LG 67%

Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA

Wentao Mo, Yang Liu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in AAAI 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02695 2024-02-07 cs.RO cs.CV 67%

VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model

Pengying Wu, Yao Mu, Bingxian Wu, Yi Hou, Ji Ma, Shanghang Zhang, Chang Liu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04047 2023-12-29 cs.CV cs.AI cs.CL cs.LG 67%

CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy Environments

Xiulong Liu, Sudipta Paul, Moitreya Chatterjee, Anoop Cherian

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05608 2023-10-09 cs.CV cs.AI cs.CL cs.LG 67%

Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis

Zhu Wang, Sourav Medya, Sathya N. Ravi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12981 2023-07-25 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

3D-LLM: Injecting the 3D World into Large Language Models

Yining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng, Yilun Du, Zhenfang Chen, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Page: : https://vis-www.cs.umass.edu/3dllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07474 2023-04-14 cs.CV cs.AI cs.CL cs.LG 67%

SQA3D: Situated Question Answering in 3D Scenes

Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, Siyuan Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2023. First two authors contributed equally. Project website: https://sqa3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03767 2023-04-10 cs.CV 67%

Embodied Concept Learner: Self-supervised Learning of Concepts and Mapping through Instruction Following

Mingyu Ding, Yan Xu, Zhenfang Chen, David Daniel Cox, Ping Luo, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments CoRL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11201 2022-07-25 cs.CV cs.AI cs.CL cs.LG 67%

Target-Driven Structured Transformer Planner for Vision-Language Navigation

Yusheng Zhao, Jinyu Chen, Chen Gao, Wenguan Wang, Lirong Yang, Haibing Ren, Huaxia Xia, Si Liu

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.11742 2022-02-25 cs.CV 67%

Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04097 2021-10-12 cs.RO cs.CV 67%

Deep Learning for Embodied Vision Navigation: A Survey

Fengda Zhu, Yi Zhu, Vincent CS Lee, Xiaodan Liang, Xiaojun Chang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.07793 2020-12-24 cs.CV 67%

Generative 3D Part Assembly via Dynamic Graph Learning

Jialei Huang, Guanqi Zhan, Qingnan Fan, Kaichun Mo, Lin Shao, Baoquan Chen, Leonidas Guibas, Hao Dong

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.09551 2020-07-21 cs.CL cs.AI cs.CV cs.LG 67%

Understanding Spatial Relations through Multiple Modalities

Soham Dan, Hangfeng He, Dan Roth

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref LREC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.04950 2019-08-15 cs.CV cs.AI cs.CL cs.LG 67%

VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering

Cătălina Cangea, Eugene Belilovsky, Pietro Liò, Aaron Courville

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at BMVC 2019. 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08755 2019-02-20 cs.CV 67%

No Blind Spots: Full-Surround Multi-Object Tracking for Autonomous Vehicles using Cameras & LiDARs

Akshay Rangesh, Mohan M. Trivedi

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.11543 2017-12-04 cs.CV cs.AI cs.CL cs.LG 67%

Embodied Question Answering

Abhishek Das, Samyak Datta, Georgia Gkioxari, Stefan Lee, Devi Parikh, Dhruv Batra

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19354 2026-03-27 cs.CL cs.AI 66%

GeoResponder: Towards Building Geospatial LLMs for Time-Critical Disaster Response

GeoResponder:迈向构建用于时间敏感灾害响应的地理空间大语言模型

Ahmed El Fekih Zguir, Ferda Ofli, Muhammad Imran

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 GeoResponder通过分层指令微调课程,赋予大语言模型空间推理能力,通过在不同认知层中分层地理空间学习,使模型能够有效处理灾害响应中的道路网络、坐标和基础设施访问问题,显著优于现有基础模型和领域特定基线。

Comments 16 pages, 5 figures, Major revision with new geospatial reasoning framework (GeoResponder), previously titled "RoadMind"

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08567 2025-11-12 cs.LG cs.AI 66%

The Path Not Taken: RLVR Provably Learns Off the Principals

Hanqing Zhu, Zhenyu Zhang, Hanxian Huang, DiJia Su, Zechun Liu, Jiawei Zhao, Igor Fedorov, Hamed Pirsiavash, Zhizhou Sha, Jinwon Lee, David Z. Pan, Zhangyang Wang, Yuandong Tian, Kai Sheng Tai

机构 * Meta AI The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Preliminary version accepted as a spotlight in NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16774 2025-10-21 cs.LG cs.AI 66%

Learning to play: A Multimodal Agent for 3D Game-Play

Yuguang Yue, Irakli Salia, Samuel Hunt, Christopher Green, Wenzhe Shi, Jonathan J Hunt

机构 * Player2

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments International Conference on Computer Vision Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.14361 2019-11-01 cs.LG cs.AI stat.ML 66%

Object-oriented state editing for HRL

Victor Bapst, Alvaro Sanchez-Gonzalez, Omar Shams, Kimberly Stachenfeld, Peter W. Battaglia, Satinder Singh, Jessica B. Hamrick

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments 8 pages; accepted to the Perception as Generative Reasoning workshop of the 33rd Conference on Neural InformationProcessing Systems (NeurIPS 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新 62%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏