arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3380 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3380 篇

2509.22281 2025-09-29 cs.CV cs.RO 78%

MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning

Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, Jiangmiao Pang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) SII Southern University of Science and Technology(南方科技大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by NeurIPS 2025; Project page: https://mesatask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21922 2025-09-29 cs.CV 78%

Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding

Vahid Mirjalili, Ramin Giahi, Sriram Kollipara, Akshay Kekuda, Kehui Yao, Kai Zhao, Jianpeng Xu, Kaushiki Nag, Sinduja Subramaniam, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 4 pages, NeurIPS Workshop SpaVLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12026 2025-09-26 cs.CV 78%

3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering

Rongtao Xu, Han Gao, Mingming Yu, Dong An, Shunpeng Chen, Changwei Wang, Li Guo, Xiaodan Liang, Shibiao Xu

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21188 2025-09-23 cs.CV 78%

GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding

Zijun Lin, Shuting He, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(计算与经济学交叉研究关键实验室,上海财经大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05669 2025-09-09 cs.CV 78%

Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance

Weijie Shen, Xinrui Wang, Yuanqi Nie, Apiradee Boonmee

机构 * Beihua University(白华大学) Kasem Bundit University(Kasem Bundit大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20851 2025-08-29 cs.CV 78%

PathMR: Multimodal Visual Reasoning for Interpretable Pathology Diagnosis

Ye Zhang, Yu Zhou, Jingwen Qi, Yongbing Zhang, Simon Puettmann, Finn Wichmann, Larissa Pereira Ferreira, Lara Sichward, Julius Keyl, Sylvia Hartmann, Shuo Zhao, Hongxiao Wang, Xiaowei Xu, Jianxu Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V.(莱比锡分析科学研究所(ISAS)) Department of Pathology, The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院病理科部) Institute of Pathology, University Hospital Essen(埃森大学医院病理科研究所) Academy for Multidisciplinary Studies, Capital Normal University(首都师范大学多学科研究学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17595 2025-08-26 cs.CV 78%

TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints

Vinh-Thuan Ly, Hoang M. Truong, Xuan-Huong Nguyen

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted for presentation at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025

Journal ref IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Hawaii, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15272 2025-08-22 cs.CV 78%

RATopo: Improving Lane Topology Reasoning via Redundancy Assignment

Han Li, Shaofei Huang, Longfei Xu, Yulu Gao, Beipeng Mu, Si Liu

机构 * School of Artificial Intelligence Beihang University Beijing China(人工智能学院 北航 北京 中国) Zhongguancun Academy Beijing China(中关村学院 北京 中国) Hangzhou International Innovation Institute Beihang University Hangzhou China(杭州国际创新研究院 北航 杭州 中国) Beihang University(北航) Zhongguancun Academy(中关村学院) University of Macau(澳门大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12400 2025-08-19 cs.CV 78%

MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models

Amirul Rahman, Qiang Xu, Xueying Huang

机构 * University of Malaya(马来大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11196 2025-08-18 cs.CV 78%

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning

Jiajin Guan, Haibo Mei, Bonan Zhang, Dan Liu, Yuanshuang Fu, Yue Zhang

机构 * Research Institute of Electronic Science and Technology, University of Electronic Science and Technology of China(电子科学与技术研究院,电子科技大学) School of Aeronautics and Astronautics, University of Electronic Science and Technology of China(航空航天学院,电子科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17659 2025-08-14 cs.CV 78%

See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering

Junjie Wang, Yunhan Tang, Yijie Wang, Zhihao Yuan, Huan Wang, Yangfan He, Bin Li

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments We are withdrawing this preprint because it is undergoing a major revision and restructuring. We feel that the current version does not convey our core contributions and methodology with sufficient clarity and accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16805 2025-08-12 cs.CV 78%

Co-VisiON: Co-Visibility ReasONing on Sparse Image Sets of Indoor Scenes

Chao Chen, Nobel Dang, Juexiao Zhang, Wenkai Sun, Pengfei Zheng, Xuhang He, Yimeng Ye, Jiasheng Zhang, Taarun Srinivas, Chen Feng

机构 * New York University(纽约大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18525 2025-08-11 cs.RO 78%

RoboTron-Nav: A Unified Framework for Embodied Navigation Integrating Perception, Planning, and Prediction

Yufeng Zhong, Chengjian Feng, Feng Yan, Fanfan Liu, Liming Zheng, Lin Ma

机构 * Meituan(美团)

专题命中 视觉空间推理 :planning(title,abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13927 2025-08-05 cs.CV 78%

Multimodal 3D Reasoning Segmentation with Complex Scenes

Xueying Jiang, Lewei Lu, Ling Shao, Shijian Lu

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00356 2025-08-04 cs.CV cs.MA 78%

Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning

Angelos Vlachos, Giorgos Filandrianos, Maria Lymperaiou, Nikolaos Spanos, Ilias Mitsouras, Vasileios Karampinis, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory, National Technical University of Athens(人工智能与学习系统实验室,国家技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23772 2025-08-01 cs.CV 78%

SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting

Di Li, Jie Feng, Jiahao Chen, Weisheng Dong, Guanbin Li, Yuhui Zheng, Mingtao Feng, Guangming Shi

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17382 2025-07-28 q-bio.NC cs.CV 78%

Unraveling the geometry of visual relational reasoning

Jiaqi Shang, Gabriel Kreiman, Haim Sompolinsky

机构 * Program in Neuroscience, Harvard Medical School(神经科学项目,哈佛医学院) Boston Children’s Hospital, Harvard Medical School(波士顿儿童医院,哈佛医学院) Center for Brains, Minds, and Machines(大脑、心智与机器中心) Edmond and Lily Safra Center for Brain Sciences, Hebrew University(埃德蒙与莉莉·萨弗脑科学中心,希伯来大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 27 pages, 7 figures, 8 SI figures, 2 SI tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15804 2025-07-11 cs.CV 78%

STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs

Zongzhao Li, Zongyang Ma, Mingze Li, Songyou Li, Yu Rong, Tingyang Xu, Ziqi Zhang, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) DAMO Academy, Alibaba Group, Hangzhou, China(阿里云达摩院) Hupan Lab, Hangzhou, China(杭州华普实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06719 2025-07-10 cs.CV cs.RO 78%

A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding

Zhenyang Liu, Sixiao Zheng, Siyu Chen, Cairong Zhao, Longfei Liang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University, Shanghai Innovation Institute(复旦大学) Zhejiang University(浙江大学) Tongji University(同济大学) NeuHelium Co., Ltd(NeuHelium公司) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05798 2025-07-09 cs.CV 78%

SPADE: Spatial-Aware Denoising Network for Open-vocabulary Panoptic Scene Graph Generation with Long- and Local-range Context Reasoning

Xin Hu, Ke Qin, Guiduo Duan, Ming Li, Yuan-Fang Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 Ubiquitous Intelligence and Trusted Services 重点实验室) Monash University(墨尔本大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04699 2025-07-08 cs.CV 78%

A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets

Zexi Jia, Chuanwei Huang, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Ying Deng, Jiapei Zhang, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc, China(腾讯公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02978 2025-07-08 cs.CV 78%

Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models

Jiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Kai Han, Guozheng Rao, Kaicheng Yu

机构 * Autolab, Westlake University(Autolab,西拉丘吉大学) Tianjin University(天津大学) Zhejiang University(浙江大学) Capital Normal University(首都师范大学) University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23352 2025-07-01 cs.CV 78%

GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields

Shunsuke Yasuki, Taiki Miyanishi, Nakamasa Inoue, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Masato Taki, Yutaka Matsuo

机构 * Rikkyo University(立命馆大学) University of Tokyo(东京大学) ATR(ATR研究所) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(国家信息研究所) NII LLMC(日本信息处理学会LLMC) Sony Semiconductor Solutions(索尼半导体解决方案)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23120 2025-07-01 cs.CV 78%

Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation

Zhenhua Ning, Zhuotao Tian, Shaoshuai Shi, Guangming Lu, Daojing He, Wenjie Pei, Li Jiang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21924 2025-06-30 cs.CV 78%

SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding

Zhao Jin, Rong-Cheng Tu, Jingyi Liao, Wenhao Sun, Xiao Luo, Shunyu Liu, Dacheng Tao

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17545 2025-06-24 cs.CV 78%

Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations

Zhihao Yuan, Shuyi Jiang, Chun-Mei Feng, Yaolun Zhang, Shuguang Cui, Zhen Li, Na Zhao

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,香港科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16701 2025-06-23 cs.CV 78%

Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition

Xiaodan Hu, Chuhang Zou, Suchen Wang, Jaechul Kim, Narendra Ahuja

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon.com LLC(亚马逊公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04623 2025-06-20 cs.CV eess.AS 78%

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14233 2025-06-18 cs.RO 78%

Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments

Amirreza Payandeh, Anuj Pokhrel, Daeun Song, Marcos Zampieri, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Information Sciences and Technology, George Mason University(信息科学与技术系,乔治·马歇尔大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24718 2025-06-10 cs.CV 78%

Reinforcing Video Reasoning with Focused Thinking

Jisheng Dang, Jingze Wu, Teng Wang, Xuanhui Lin, Nannan Zhu, Hongbo Chen, Wei-Shi Zheng, Meng Wang, Tat-Seng Chua

机构 * Sun Yat-sen University(中山大学) Lanzhou University(兰州大学) University of Hong Kong(香港大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏