arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3380 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3380 篇

2506.04837 2025-06-06 cs.CV 78%

OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model

Kunshen Zhang

机构 * Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project Page: https://github.com/Zhangkuns/OpenMaskDINO3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10042 2025-06-05 cs.CV 78%

EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability

Ziyue Wang, Yurui Dong, Fuwen Luo, Minyuan Ruan, Zhili Cheng, Chi Chen, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Management, Fudan University, Shanghai, China(管理学院,复旦大学,上海,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01371 2025-06-03 cs.CV 78%

SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization

Peiyao Wang, Haibin Ling

机构 * Department of Computer Science, Stony Brook University(计算机科学系,石板溪大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24257 2025-06-02 cs.CV 78%

Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames

Sahithya Ravi, Gabriel Sarch, Vibhav Vineet, Andrew D. Wilson, Balasaravanan Thoravi Kumaravel

机构 * University of British Columbia(不列颠哥伦比亚大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research, Redmond WA(微软研究院(红mond, WA))

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00954 2025-05-29 cs.CV 78%

Hypo3D: Exploring Hypothetical Reasoning in 3D

Ye Mao, Weixun Luo, Junpeng Jing, Anlan Qiu, Krystian Mikolajczyk

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 24 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20777 2025-05-28 cs.CV 78%

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Zhehan Kan, Yanlin Liu, Kun Yin, Xinghua Jiang, Xin Li, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun, Qingmin Liao, Wenming Yang

机构 * Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16517 2025-05-27 cs.RO cs.CV 78%

ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models

Zirui Song, Guangxian Ouyang, Mingzhe Li, Yuheng Ji, Chenxi Wang, Zixiang Xu, Zeyu Zhang, Xiaoqing Zhang, Qian Jiang, Zhenhao Chen, Zhongzhi Li, Rui Yan, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ByteDance(字节跳动) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Australia National University(澳大利亚国立大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16663 2025-05-23 cs.CV cs.MM 78%

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Haihong Hao, Mingfei Han, Changlin Li, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01805 2025-05-22 cs.CV 78%

SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Nanyang Technological University(南洋理工大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11907 2025-05-20 cs.CV 78%

Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?

Zihao Dongfang, Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Danda Pani Paudel, Luc Van Gool, Kailun Yang, Xuming Hu

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11838 2025-05-20 cs.CV 78%

RVTBench: A Benchmark for Visual Reasoning Tasks

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10875 2025-05-19 cs.CV 78%

A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision

Alexey Magay, Dhurba Tripathi, Yu Hao, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab New York University Abu Dhabi(embodied AI 和机器人(AIR)实验室 新 York 大学阿布扎赫德)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project website and code: https://dktpt44.github.io/LV-GPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09118 2025-05-15 cs.CV 78%

Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning

Dayong Liang, Changmeng Zheng, Zhiyuan Wen, Yi Cai, Xiao-Yong Wei, Qing Li

机构 * South China University of Technology(华南理工大学) The Hong Kong Polytechnic University(香港理工大学) Peng Cheng Laboratory(彭成实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17207 2025-04-25 cs.CV 78%

Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation

Phillip Y. Lee, Jihyeon Je, Chanho Park, Mikaela Angelina Uy, Leonidas Guibas, Minhyuk Sung

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project Page: https://apc-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18894 2025-04-22 cs.CV 78%

T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous Driving

Changsheng Lv, Mengshi Qi, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10854 2025-04-16 cs.CV 78%

LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation

Hanning Chen, Yang Ni, Wenjun Huang, Hyunwoo Oh, Yezi Liu, Tamoghno Das, Mohsen Imani

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17735 2025-04-07 cs.CV cs.RO 78%

3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning

Yuncong Yang, Han Yang, Jiachen Zhou, Peihao Chen, Hongxin Zhang, Yilun Du, Chuang Gan

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20213 2025-04-02 cs.CV 78%

Mind the GAP: Glimpse-based Active Perception improves generalization and sample efficiency of visual reasoning

Oleh Kolner, Thomas Ortner, Stanisław Woźniak, Angeliki Pantazi

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 10 pages of main text and 8 pages appendices

Journal ref The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23297 2025-04-01 cs.CV 78%

ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning

Zhenyang Liu, Yikai Wang, Sixiao Zheng, Tongying Pan, Longfei Liang, Yanwei Fu, Xiangyang Xue

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06787 2025-03-31 cs.CV 78%

Visual Agentic AI for Spatial Reasoning with a Dynamic API

Damiano Marsili, Rohun Agrawal, Yisong Yue, Georgia Gkioxari

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project website: https://glab-caltech.github.io/vadar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19355 2025-03-27 cs.CV 78%

ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models

Dohwan Ko, Sihyeon Kim, Yumin Suh, Vijay Kumar B. G, Minseo Yoon, Manmohan Chandraker, Hyunwoo J. Kim

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14743 2025-03-11 cs.CV 78%

VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding

Ahmad Mahmood, Ashmal Vayani, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04919 2025-03-10 cs.CV 78%

FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement

Ian Huang, Yanan Bao, Karen Truong, Howard Zhou, Cordelia Schmid, Leonidas Guibas, Alireza Fathi

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10046 2025-02-17 cs.GR cs.CV 78%

ViRAC: A Vision-Reasoning Agent Head Movement Control Framework in Arbitrary Virtual Environments

Juyeong Hwang, Seong-Eun Hong, Hyeongyeop Kang

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17331 2025-02-17 cs.CV 78%

Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering

Zeqing Wang, Wentao Wan, Qiqing Lao, Runmeng Chen, Minjie Lang, Xiao Wang, Keze Wang, Liang Lin

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17427 2025-02-11 cs.CV 78%

Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model

Kuan-Chih Huang, Xiangtai Li, Lu Qi, Shuicheng Yan, Ming-Hsuan Yang

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted to 3DV 2025. Project Page: https://reason3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17647 2024-12-30 cs.CV 78%

MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning

Tieyuan Chen, Huabin Liu, Tianyao He, Yihang Chen, Chaofan Gan, Xiao Ma, Cheng Zhong, Yang Zhang, Yingxue Wang, Hui Lin, Weiyao Lin

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted at NeurIPS 2024 as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06292 2024-12-10 cs.CV 78%

ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models

Bingchen Gong, Diego Gomez, Abdullah Hamdi, Abdelrahman Eldesokey, Ahmed Abdelreheem, Peter Wonka, Maks Ovsjanikov

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project website is accessible at https://sites.google.com/view/zerokey

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00318 2024-11-06 cs.RO cs.CV 78%

Cognitive Planning for Object Goal Navigation using Generative AI Models

Arjun P S, Andrew Melnik, Gora Chand Nandi

专题命中 视觉空间推理 :planning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20883 2024-11-04 cs.CV 78%

Improving Generalization in Visual Reasoning via Self-Ensemble

Tien-Huy Nguyen, Quang-Khai Tran, Anh-Tuan Quang-Hoang

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏