arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2509.25852 2025-10-01 cs.RO 67%

Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation

Zitong Bo, Yue Hu, Jinming Ma, Mingliang Zhou, Junhui Yin, Yachen Kang, Yuqi Liu, Tong Wu, Diyun Xiang, Hao Chen

机构 * Xiaomi Robotics Lab(小米机器人实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20328 2025-10-01 cs.LG cs.AI cs.CV cs.RO 67%

Video models are zero-shot learners and reasoners

Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, Robert Geirhos

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://video-zero-shot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22991 2025-09-30 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning

Jasin Cekinmez, Omid Ghahroodi, Saad Fowad Chandle, Dhiman Gupta, Ehsaneddin Asgari

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Princeton University(普林斯顿大学) Virginia Tech(弗吉尼亚理工大学) Amity University(阿米蒂大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20843 2025-09-26 cs.RO 67%

MTRDrive: Memory-Tool Synergistic Reasoning for Robust Autonomous Driving in Corner Cases

Ziang Luo, Kangan Qian, Jiahua Wang, Yuechen Luo, Jinyu Miao, Zheng Fu, Yunlong Wang, Sicong Jiang, Zilin Huang, Yifei Hu, Yuhao Yang, Hao Ye, Mengmeng Yang, Xiaojian Dong, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部) McGill University(麦吉尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17437 2025-09-23 cs.CL 67%

GeoPQA: Bridging the Visual Perception Gap in MLLMs for Geometric Reasoning

Guizhen Chen, Weiwen Xu, Hao Zhang, Hou Pong Chan, Deli Zhao, Anh Tuan Luu, Yu Rong

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华普实验室)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract)

Comments Accepted to EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16989 2025-09-23 cs.CL 67%

All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark

Davide Testa, Giovanni Bonetta, Raffaella Bernardi, Alessandro Bondielli, Alessandro Lenci, Alessio Miaschi, Lucia Passaro, Bernardo Magnini

机构 * Università di Roma La Sapienza(罗马La Sapienza大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会) Free University of Bozen-Bolzano(博兹纳-博尔扎诺自由大学) Dept. of Computer Science, University of Pisa(比萨大学计算机科学系) CoLing Lab, Dept. of Philology, Literature and Linguistics, University of Pisa(比萨大学语言学、文学与语言学系CoLing实验室) Istituto di Linguistica Computazionale "A. Zampolli" (CNR-ILC), ItaliaNLP Lab, Pisa(A. Zampolli计算语言学研究所(CNR-ILC),意大利NLP实验室,比萨)

专题命中 视觉推理 :vision language model(abstract);visual language model(abstract)

Comments Accepted at Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15217 2025-09-19 cs.AI cs.CV cs.LG 67%

Generalizable Geometric Image Caption Synthesis

Yue Xin, Wenyuan Wang, Rui Pan, Ruida Wang, Howard Meng, Renjie Pi, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗格斯大学) NVIDIA

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17180 2025-09-10 cs.AI cs.CV cs.LG 67%

MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes

Nilay Pande, Sahiti Yerramilli, Jayant Sravan Tamarapalli, Rynaa Grover

机构 * Waymo Google(谷歌)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12312 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Visuospatial Cognitive Assistant

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 31 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02175 2025-09-05 cs.CV cs.AI cs.CL cs.LG 67%

Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks

Nils Hoehing, Mayug Maniparambil, Ellen Rushe, Noel E. O'Connor, Anthony Ventresque

机构 * School of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Computing(计算机科学学院) Dublin City University(都柏林城市大学) School of Electronic Engineering(电子工程学院) Trinity College Dublin(都柏林三一学院)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18798 2025-09-03 cs.CL 67%

Distill Visual Chart Reasoning Ability from LLMs to MLLMs

Wei He, Zhiheng Xi, Wanxu Zhao, Xiaoran Fan, Yiwen Ding, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Weixin Group, Tencent(腾讯Weixin部门) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

Comments Accepted to EMNLP 2025 Findings. The code and dataset are publicly available at https://github.com/hewei2001/ReachQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12916 2025-08-19 cs.RO 67%

RoboRetriever: Single-Camera Robot Object Retrieval via Active and Interactive Perception with Dynamic Scene Graph

Hecheng Wang, Jiankun Ren, Jia Yu, Lizhe Qi, Yunquan Sun

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10433 2025-08-15 cs.AI cs.CV cs.LG 67%

We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning

Runqi Qiao, Qiuna Tan, Peiqing Yang, Yanzi Wang, Xiaowan Wang, Enhui Wan, Sitong Zhou, Guanting Dong, Yuchen Zeng, Yida Xu, Jie Wang, Chong Sun, Chen Li, Honggang Zhang

机构 * BUPT(北京邮电大学) WeChat Vision, Tencent Inc.(腾讯公司) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07554 2025-08-12 cs.MM 67%

FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding

Xusheng He, Wei Liu, Shanshan Ma, Qian Liu, Chenghao Ma, Jianlong Wu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06826 2025-08-12 cs.HC 67%

AdjustAR: AI-Driven In-Situ Adjustment of Site-Specific Augmented Reality Content

Nels Numan, Jessica Van Brummelen, Ziwen Lu, Anthony Steed

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

Comments 4 pages, 1 figure, ACM UIST 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05221 2025-08-08 cs.CV cs.AI cs.LG 67%

ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking

Xiao Wang, Liye Jin, Xufeng Lou, Shiao Wang, Lan Chen, Bo Jiang, Zhipeng Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10011 2025-08-05 cs.RO 67%

KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks

Edgar Anarossi, Yuhwan Kwon, Hirotaka Tahara, Shohei Tanaka, Keisuke Shirai, Masashi Hamaya, Cristian C. Beltran-Hernandez, Atsushi Hashimoto, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology(信息科学系,科学技术研究生学校,科学技术研究所) Department of Electrical and Electronic Engineering, Faculty of Engineering Science, Kansai University(电气电子工程系,工学科学大学) Department of Electronics, Kobe City College of Technology(电子系,神户市立技术学院) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments Published in IEEE Access, Jul 14 2025

Journal ref IEEE Access, vol. 13, pp. 125420-125441, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22958 2025-08-01 cs.CV cs.AI cs.LG 67%

CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam

Ruslan Khrulev

机构 * Moscow State University(莫斯科国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 15 pages, 3 figures, 10 tables. Code is available at: https://github.com/Karifannaa/Auto-check-EGE-math

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10062 2025-07-25 cs.SE 67%

LLMShot: Reducing snapshot testing maintenance via LLMs

Ergün Batuhan Kaynak, Mayasah Lami, Sahand Moslemi, Anil Koyuncu

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)

Comments Accepted to ICSME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08306 2025-07-14 cs.AI cs.CL cs.CV cs.LG 67%

M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning

Inclusion AI, :, Fudong Wang, Jiajia Liu, Jingdong Chen, Jun Zhou, Kaixiang Ji, Lixiang Ru, Qingpei Guo, Ruobing Zheng, Tianqi Li, Yi Yuan, Yifan Mao, Yuting Xiao, Ziping Ma

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 31pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02600 2025-07-04 cs.RO 67%

ArtGS:3D Gaussian Splatting for Interactive Visual-Physical Modeling and Manipulation of Articulated Objects

Qiaojun Yu, Xibin Yuan, Yu jiang, Junting Chen, Dongzhe Zheng, Ce Hao, Yang You, Yixing Chen, Yao Mu, Liu Liu, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(国立新加坡大学) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21655 2025-06-30 cs.LG cs.AI cs.CV 67%

APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization

Minjie Hong, Zirun Guo, Yan Xia, Zehan Wang, Ziang Zhang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13056 2025-06-27 cs.AI cs.CV cs.LG 67%

Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning

Haibo Qiu, Xiaohan Lan, Fanfan Liu, Xiaohu Sun, Delian Ruan, Peng Shi, Lin Ma

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Page: https://github.com/MM-Thinking/Metis-RISE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16141 2025-06-23 cs.CV cs.AI cs.CL cs.LG 67%

GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code released at: https://github.com/TencentARC/GRPO-CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13761 2025-06-17 cs.RO 67%

Prompting with the Future: Open-World Model Predictive Control with Interactive Digital Twins

Chuanruo Ning, Kuan Fang, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05523 2025-06-09 cs.CV cs.AI cs.CL cs.LG 67%

MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning

Zikui Cai, Andrew Wang, Anirudh Satheesh, Ankit Nakhawa, Hyunwoo Jae, Keenan Powell, Minghui Liu, Neel Jay, Sungbin Oh, Xiyao Wang, Yongyuan Liang, Tom Goldstein, Furong Huang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04088 2025-06-05 cs.LG cs.AI cs.CL cs.CV 67%

Multimodal Tabular Reasoning with Privileged Structured Information

Jun-Peng Jiang, Yu Xia, Hai-Long Sun, Shiyin Lu, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) AI Business, Alibaba Group(阿里集团人工智能业务)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01953 2025-06-03 cs.RO 67%

Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning

Hao Chen, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Renrui Zhang, Xiaoqi Li, Xiao He, Yandong Guo, Chi-Wing Fu, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) AI 2 Robotics(人工智能与机器人) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00235 2025-06-03 cs.CL 67%

MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility

Yexiao He, Ang Li, Boyi Liu, Zhewei Yao, Yuxiong He

专题命中 视觉推理 :visual question answering(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18792 2025-05-27 cs.RO 67%

On the Dual-Use Dilemma in Physical Reasoning and Force

William Xie, Enora Rice, Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏