arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2510.03727 2025-10-07 cs.AI cs.CL cs.CV cs.LG 67%

Bridging the Gap Between Multimodal Foundation Models and World Models

Xuehai He

机构 * Computer Science and Engineering University of California, Santa Cruz(计算机科学与工程大学加州大学圣克ruz分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00855 2025-10-02 cs.CV cs.AI cs.CL cs.LG 67%

Can World Models Benefit VLMs for World Dynamics?

Kevin Zhang, Kuangzhi Ge, Xiaowei Chi, Renrui Zhang, Shaojun Shi, Zhen Dong, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page: https://dyva-worldlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11812 2025-10-01 cs.AI cs.CL cs.LG 67%

On the Performance of LLMs for Real Estate Appraisal

Margot Geerts, Manon Reusens, Bart Baesens, Seppe vanden Broucke, Jochen De Weerdt

机构 * LIRIS, KU Leuven, Leuven, Belgium(LIRIS,KU莱顿,比利时) Department of Business Informatics and Operations Management, Ghent University, Ghent, Belgium(商业信息学与运营管理系,根特大学,比利时) Department of Decision Analytics and Risk, University of Southampton, Southampton, UK(决策分析与风险系,南安普顿大学,英国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ECML-PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22441 2025-09-29 cs.RO 67%

UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation

Zhangyuan Wang, Yunpeng Zhu, Yuqi Yan, Xiaoyuan Tian, Xinhao Shao, Meixuan Li, Weikun Li, Guangsheng Su, Weicheng Cui, Dixia Fan

机构 * School of Engineering, Westlake University(西lake大学工程学院) College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) College of Environmental and Resource Sciences, Zhejiang University(浙江大学环境与资源科学学院) Australian National University(澳大利亚国立大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments This paper introduces the first VLA framework for AUVs, featuring a dual-brain architecture and zero-data MPC for real-world underwater navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16975 2025-09-29 cs.LG cs.AI cs.CL 67%

Latent Concept Disentanglement in Transformer-based Language Models

Guan Zhe Hong, Bhavya Vasudeva, Vatsal Sharan, Cyrus Rashtchian, Prabhakar Raghavan, Rina Panigrahy

机构 * Purdue University(普渡大学) University of Southern California(南加州大学) Google(谷歌)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12312 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Visuospatial Cognitive Assistant

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09444 2025-08-14 cs.RO cs.CV 67%

DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation

Haoxiang Shi, Xiang Deng, Zaijing Li, Gongwei Chen, Yaowei Wang, Liqiang Nie

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14769 2025-08-12 cs.CV cs.RO 67%

CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion

Jiahua Ma, Yiran Qin, Yixiong Li, Xuanqi Liao, Yulan Guo, Ruimao Zhang

机构 * Sun Yat-sen University(中山大学) CUHK(SZ)(香港中文大学(深圳)) Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11571 2025-07-21 cs.CV 67%

VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?

Jiachen Yu, Yufei Zhan, Ziheng Wu, Yousong Zhu, Jinqiao Wang, Minghui Qiu

机构 * Tsinghua University(清华大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance China(字节跳动中国) Peng Cheng Laboratory(鹏城实验室) Wuhan AI Research(武汉人工智能研究)

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12955 2025-07-17 cs.CV 67%

HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding

Jiahe Zhao, Ruibing Hou, Zejie Tian, Hong Chang, Shiguang Shan

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室) Institute of Computing Technology, CAS(中国科学院计算技术研究所) University of CAS(中国科学院大学) Communication University of China(通信大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20129 2025-07-08 cs.CV cs.GR 67%

Agentic 3D Scene Generation with Spatially Contextualized VLMs

Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Project page: https://spatctxvlm.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14171 2025-07-04 cs.CV 67%

Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Jihan Yang, Shusheng Yang, Anjali W. Gupta, Rilyn Han, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments Project page: https://vision-x-nyu.github.io/thinking-in-space.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17221 2025-06-26 cs.CV 67%

VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning

Zhangyang Qi, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments project page: vlnr1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10069 2025-06-18 cs.RO cs.CV 67%

SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation

Xiangyu Shi, Zerui Li, Wenqi Lyu, Jiatong Xia, Feras Dayoub, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning at the University of Adelaide(澳大利亚机器学习研究所(阿德莱德大学))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Accepted by IROS 2025. Project website: https://sxyxs.github.io/smartway/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10966 2025-06-13 cs.RO 67%

GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation

Ning Gao, Yilun Chen, Shuai Yang, Xinyi Chen, Yang Tian, Hao Li, Haifeng Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06487 2025-06-10 cs.RO 67%

BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation

Zibo Zhou, Yue Hu, Lingkai Zhang, Zonglin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16310 2025-05-29 cs.CV 67%

Functionality understanding and segmentation in 3D scenes

Jaime Corsetti, Francesco Giuliari, Alice Fasoli, Davide Boscaini, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments CVPR 2025 Highlight. Camera ready version. 20 pages, 12 figures, 7 tables. Fixed typo in Eq.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03757 2025-05-09 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding

Yunze Man, Shuhong Zheng, Zhipeng Bao, Martial Hebert, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024. Project page: https://yunzeman.github.io/lexicon3d Github: https://github.com/YunzeMan/Lexicon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13966 2025-03-19 cs.CV cs.RO 67%

FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks

Siqi Zhang, Yanyuan Qiao, Qunbo Wang, Longteng Guo, Zhihua Wei, Jing Liu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11794 2025-03-18 cs.CV cs.AI cs.CL cs.LG 67%

Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection

Bangzheng Li, Fei Wang, Wenxuan Zhou, Nan Xu, Ben Zhou, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08330 2025-03-12 cs.RO 67%

KiteRunner: Language-Driven Cooperative Local-Global Navigation Policy with UAV Mapping in Outdoor Environments

Shibo Huang, Chenfan Shi, Jian Yang, Hanlin Dong, Jinpeng Mi, Ke Li, Jianfeng Zhang, Miao Ding, Peidong Liang, Xiong You, Xian Wei

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06313 2025-03-11 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Advancing Autonomous Vehicle Intelligence: Deep Learning and Multimodal LLM for Traffic Sign Recognition and Robust Lane Detection

Chandan Kumar Sah, Ankit Kumar Shaw, Xiaoli Lian, Arsalan Shahid Baig, Tuopu Wen, Kun Jiang, Mengmeng Yang, Diange Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08202 2025-02-19 cs.CV cs.AI cs.CL cs.LG 67%

What Makes a Maze Look Like a Maze?

Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Noah D. Goodman, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00358 2025-01-10 cs.CV 67%

Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding

Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments project page: https://embodied-videoagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02938 2024-11-06 cs.RO 67%

Multi-Modal 3D Scene Graph Updater for Shared and Dynamic Environments

Emilio Olivastri, Jonathan Francis, Alberto Pretto, Niko Sünderhauf, Krishan Rana

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments This paper has been accepted at the Workshop on Lifelong Learning for Home Robots at the 8th Conference on Robot Learning (CoRL 2024), Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18722 2024-10-15 cs.RO cs.CV 67%

Towards Open-World Grasping with Large Vision-Language Models

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 8th Conference on Robot Learning (CoRL 2024), Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08189 2024-10-11 cs.CV cs.RO 67%

SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation

Hang Yin, Xiuwei Xu, Zhenyu Wu, Jie Zhou, Jiwen Lu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments Accepted to NeurIPS 2024. Project page: https://bagh2178.github.io/SG-Nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11801 2024-08-22 cs.CV 67%

Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models

Yuzhou Huang, Yiran Qin, Shunlin Lu, Xintao Wang, Rui Huang, Ying Shan, Ruimao Zhang

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)

Comments Project page: https://yuzhou914.github.io/Story3D-Agent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06094 2024-07-12 cs.CV cs.AI cs.CL cs.LG 67%

Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding

Mu Cai, Zeyi Huang, Yuheng Li, Utkarsh Ojha, Haohan Wang, Yong Jae Lee

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15852 2024-07-02 cs.CV cs.RO 67%

NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation

Jiazhao Zhang, Kunyu Wang, Rongtao Xu, Gengze Zhou, Yicong Hong, Xiaomeng Fang, Qi Wu, Zhizheng Zhang, He Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Accepted by Robotics: Science and Systems (RSS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏