arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2508.10012 2025-08-15 cs.CL 57%

Guided Navigation in Knowledge-Dense Environments: Structured Semantic Exploration with Guidance Graphs

Dehao Tao, Guangjie Liu, Weizheng, Yongfeng Huang, Minghu jiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10778 2025-08-15 cs.CV cs.AI 57%

Warehouse Spatial Question Answering with LLM Agent

Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang

机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 1st Place Solution of the 9th AI City Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02095 2025-08-08 cs.CV cs.AI 57%

VLM4D: Towards Spatiotemporal Awareness in Vision Language Models

Shijie Zhou, Alexander Vilesov, Xuehai He, Ziyu Wan, Shuwang Zhang, Aditya Nagachandra, Di Chang, Dongdong Chen, Xin Eric Wang, Achuta Kadambi

机构 * UCLA(美国大学洛杉矶分校) Microsoft(微软公司) UCSC(加州大学圣塔克拉拉分校) USC(美国大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments ICCV 2025, Project Website: https://vlm4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03009 2025-08-06 cs.CV cs.AI 57%

Enhancing Long Video Question Answering with Scene-Localized Frame Grouping

Xuyi Yang, Wenhao Zhang, Hongbo Jin, Lin Liu, Hongbo Xu, Yongwei Nie, Fei Yu, Fei Ma

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11859 2025-08-06 cs.CV cs.CL 57%

Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics

Wenrui Xu, Dalin Lyu, Weihang Wang, Jie Feng, Chen Gao, Yong Li

机构 * School of Architecture, Tsinghua University(清华大学建筑学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.CL

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. Volume 1: Long Papers (2025) 11571-11590

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18937 2025-08-05 cs.CV cs.CL 57%

Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description

Mahmoud Ahmed, Junjie Fei, Jian Ding, Eslam Mohamed Bakr, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡斯特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19516 2025-08-05 cs.RO cs.LG 57%

Boosting Robotic Manipulation Generalization with Minimal Costly Data

Liming Zheng, Feng Yan, Fanfan Liu, Chengjian Feng, Yufeng Zhong, Lin Ma

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00213 2025-08-04 cs.CV cs.LG 57%

SAM-PTx: Text-Guided Fine-Tuning of SAM with Parameter-Efficient, Parallel-Text Adapters

Shayan Jalilian, Abdul Bais

机构 * University of Regina(里纳大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23698 2025-08-01 cs.RO cs.AI 57%

Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents

Shaofei Cai, Zhancun Mu, Haiwen Xia, Bowei Zhang, Anji Liu, Yitao Liang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23272 2025-08-01 cs.CV cs.AI 57%

Towards Affordable Tumor Segmentation and Visualization for 3D Breast MRI Using SAM2

Solha Kang, Eugene Kim, Joris Vankerschaver, Utku Ozbulak

机构 * Center for Biosystems and Biotech Data Science, Ghent University Global Campus, Incheon, Republic of Korea(生物系统与生物技术数据科学中心,格罗宁根大学全球校园,韩国Incheon) Department of Mathematics, Computer Science and Statistics, Ghent University, Ghent, Belgium(数学、计算机科学与统计学系,格罗宁根大学,比利时Ghent) IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(IDLab,电子与信息系统系,格罗宁根大学,比利时Ghent)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments Accepted for publication in the 28th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI), 2nd Deep Breast Workshop on AI and Imaging for Diagnostic and Treatment Challenges in Breast Care (DeepBreath), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20850 2025-07-29 cs.RO cs.AI 57%

Free Energy-Inspired Cognitive Risk Integration for AV Navigation in Pedestrian-Rich Environments

Meiting Dang, Yanping Wu, Yafei Wang, Dezong Zhao, David Flynn, Chongfeng Wei

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18678 2025-07-28 cs.CV cs.AI 57%

Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting

Xingyu Miao, Haoran Duan, Quanhao Qian, Jiuniu Wang, Yang Long, Ling Shao, Deli Zhao, Ran Xu, Gongjie Zhang

机构 * Durham University(杜ham大学) DAMO Academy, Alibaba Group(达摩院,阿里集团) Tsinghua University(清华大学) UCAS-Terminus AI Lab(北航-terminate人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01655 2025-07-22 cs.RO cs.AI 57%

Stimulating Imagination: Towards General-purpose "Something Something Placement"

Jianyang Wu, Jie Gu, Xiaokang Ma, Fangzhou Qiu, Chu Tang, Jingmin Chen

机构 * Rightly Robotics(Rightly机器人)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, accepted to the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13858 2025-07-21 cs.CL 57%

InTraVisTo: Inside Transformer Visualisation Tool

Nicolò Brunello, Davide Rigamonti, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10500 2025-07-15 cs.RO cs.AI cs.CV cs.HC 57%

Scene-Aware Conversational ADAS with Generative AI for Real-Time Driver Assistance

Kyungtae Han, Yitao Chen, Rohit Gupta, Onur Altintas

机构 * InfoTech Labs, Toyota Motor North America(丰田北美信息科技实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06184 2025-06-30 cs.CV cs.AI cs.CE cs.HC cs.MA 57%

PEACE: Empowering Geologic Map Holistic Understanding with MLLMs

Yangyu Huang, Tianyi Gao, Haoran Xu, Qihao Zhao, Yang Song, Zhipeng Gui, Tengchao Lv, Hao Chen, Lei Cui, Scarlett Li, Furu Wei

机构 * Microsoft Research(微软研究院) Chinese Academy of Geological Sciences(中国地质科学研究院) Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08704 2025-06-30 cs.CV cs.AI 57%

Beyond the Hype: A dispassionate look at vision-language models in medical scenario

Yang Nan, Huichi Zhou, Xiaodan Xing, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(生物工程部门和Imperial-X,帝国理工学院伦敦分校) GSK, Artificial Intelligence and Machine Learning(GSK,人工智能与机器学习) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里托尼医院) School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19498 2025-06-25 cs.RO cs.AI 57%

T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models

Yiteng Chen, Wenbo Li, Shiyi Wang, Huiping Zhuang, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19312 2025-06-25 cs.CV cs.AI 57%

Capturing Fine-Grained Alignments Improves 3D Affordance Detection

Junsei Tokumitsu, Yuiga Wada

机构 * Keio AI Research Center(庆应AI研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments MVA 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17425 2025-06-25 eess.IV cs.AI cs.CV 57%

Trans${^2}$-CBCT: A Dual-Transformer Framework for Sparse-View CBCT Reconstruction

Minmin Yang, Huantao Ren, Senem Velipasalar

机构 * Department of Electrical Engineering and Computer Science at Syracuse University(苏利文大学电气工程与计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18683 2025-06-24 cs.CV cs.AI 57%

SIM-Net: A Multimodal Fusion Network Using Inferred 3D Object Shape Point Clouds from RGB Images for 2D Classification

Youcef Sklab, Hanane Ariouat, Eric Chenin, Edi Prifti, Jean-Daniel Zucker

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 25 pages, 9 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13318 2025-06-24 cs.CV cs.LG eess.IV 57%

VesselGPT: Autoregressive Modeling of Vascular Geometry

Paula Feldman, Martin Sinnona, Claudio Delrieux, Viviana Siless, Emmanuel Iarussi

机构 * Consejo Nacional de Investigaciones Científicas y Técnicas(阿根廷国家科学与技术研究院) Universidad Nacional del Sur(国立南方大学) Universidad Torcuato Di Tella(托克托迪塔拉大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments Accepted for MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16623 2025-06-23 cs.RO cs.AI 57%

History-Augmented Vision-Language Models for Frontier-Based Zero-Shot Object Navigation

Mobin Habibpour, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering, Clemson University, Clemson, SC, USA(霍尔科姆电气与计算机工程系,克莱姆森大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14782 2025-06-23 cs.LG q-bio.QM 57%

Integrating Dynamical Systems Learning with Foundational Models: A Meta-Evolutionary AI Framework for Clinical Trials

Joseph Geraci, Bessi Qorri, Christian Cumbaa, Mike Tsay, Paul Leonczyk, Luca Pani

机构 * NetraMark Corp.(NetraMark公司) Queen’s University(女王大学) Tandem Centre for Pharmacogenetics(药基因学中心) UC San Diego(圣地亚哥大学) University of Miami(迈阿密大学) University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20499 2025-06-19 cs.LG 57%

Data Distributional Properties As Inductive Bias for Systematic Generalization

Felipe del Rio, Alain Raymond-Saez, Daniel Florea, Rodrigo Toro Icarte, Julio Hurtado, Cristian B. Calderon, Alvaro Soto

机构 * Pontificia Universidad Católica de Chile(天主教智利大学) University of Warwick(沃里克大学) CENIA

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21015 2025-06-16 cs.CL cs.HC 57%

MapQaTor: An Extensible Framework for Efficient Annotation of Map-Based QA Datasets

Mahir Labib Dihan, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(墨尔本大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14254 2025-06-12 cs.RO cs.AI 57%

Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation

Lingfeng Zhang, Yuecheng Liu, Zhanguang Zhang, Matin Aghaei, Yaochen Hu, Hongjian Gu, Mohammad Ali Alomrani, David Gamaliel Arcos Bravo, Raika Karimi, Atia Hamidizadeh, Haoping Xu, Guowei Huang, Zhanpeng Zhang, Tongtong Cao, Weichao Qiu, Xingyue Quan, Jianye Hao, Yuzheng Zhuang, Yingxue Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08189 2025-06-11 cs.CV cs.CL 57%

Open World Scene Graph Generation using Vision Language Models

Amartya Dutta, Kazi Sajeed Mehrab, Medha Sawhney, Abhilash Neog, Mridul Khurana, Sepideh Fatemi, Aanish Pradhan, M. Maruf, Ismini Lourentzou, Arka Daw, Anuj Karpatne

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments Accepted in CVPR 2025 Workshop (CVinW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03969 2025-06-05 cs.AI 57%

Craftium: Bridging Flexibility and Efficiency for Rich 3D Single- and Multi-Agent Environments

Mikel Malagón, Josu Ceberio, Jose A. Lozano

机构 * Department of Computer Science and Artificial Intelligence, University of the Basque Country UPV/EHU(计算机科学与人工智能系,巴斯克国家大学UPV/EHU) Basque Center for Applied Mathematics (BCAM)(巴斯克应用数学中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments ICML 2025. Project's website: https://github.com/mikelma/craftium/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00927 2025-06-03 cs.SD cs.AI eess.AS 57%

In-the-wild Audio Spatialization with Flexible Text-guided Localization

Tianrui Pan, Jie Liu, Zewen Huang, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏