arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2508.05383 2025-08-08 cs.AI 57%

StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models

Xiangxiang Zhang, Jingxuan Wei, Donghong Zhong, Qi Chen, Caijun Jia, Cheng Tan, Jinming Gu, Xiaobo Qin, Zhiping Liu, Liang Hu, Tong Sun, Yuchen Wu, Zewei Sun, Chenwei Lou, Hua Zheng, Tianyang Zhan, Changbao Wang, Shuangzhi Wu, Zefa Lin, Chang Guo, Sihang Yuan, Riwei Chen, Shixiong Zhao, Yingping Zhang, Gaowei Wu, Bihui Yu, Jiahui Wu, Zhehui Zhao, Qianqian Liu, Ruofeng Tang, Xingyue Huang, Bing Zhao, Mengyang Zhang, Youqiang Zhou

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04043 2025-08-07 cs.CV 57%

VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning

Yuheng Ji, Yipu Wang, Yuyang Liu, Xiaoshuai Hao, Yue Liu, Yuting Zhao, Huaihai Lyu, Xiaolong Zheng

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03173 2025-08-06 cs.AI 57%

Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions

Jingxuan Wei, Caijun Jia, Qi Chen, Honghao He, Linzhuang Sun, Conghui He, Lijun Wu, Bihui Yu, Cheng Tan

机构 * Shenyang institute of computing technology, Chinese academy of sciences(沈阳计算技术研究所,中国科学院) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00217 2025-08-04 cs.CL cs.DB cs.LG 57%

Tabular Data Understanding with LLMs: A Survey of Recent Advances and Challenges

Xiaofeng Wu, Alan Ritter, Wei Xu

机构 * College of Computing, Georgia Institute of Technology(计算学院、佐治亚理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20808 2025-08-04 cs.AI 57%

MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts

Peijie Wang, Zhong-Zhi Li, Fei Yin, Xin Yang, Dekang Ran, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 45 pages, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23734 2025-08-01 cs.CV cs.RO 57%

RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping

Dongming Wu, Yanping Fu, Saike Huang, Yingfei Liu, Fan Jia, Nian Liu, Feng Dai, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jianbing Shen

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Dexmal Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SKL-IOTSC, CIS, University of Macau(澳门科学馆-物联网与智能系统研究中心,澳门大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. The code is at https://github.com/wudongming97/AffordanceNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23478 2025-08-01 cs.CV 57%

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding

Ting Huang, Zeyu Zhang, Hao Tang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23226 2025-08-01 cs.CV 57%

Toward Safe, Trustworthy and Realistic Augmented Reality User Experience

Yanming Xiu

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 2 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20509 2025-07-29 cs.RO cs.AI cs.SY eess.SY 57%

LLMs-guided adaptive compensator: Bringing Adaptivity to Automatic Control Systems with Large Language Models

Zhongchao Zhou, Yuxi Lu, Yaonan Zhu, Yifan Zhao, Bin He, Liang He, Wenwen Yu, Yusuke Iwasawa

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13629 2025-07-29 cs.CV 57%

FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding

Chenlu Zhan, Yufei Zhang, Gaoang Wang, Hongwei Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Biomedical Engineering and Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17382 2025-07-28 q-bio.NC cs.CV 57%

Unraveling the geometry of visual relational reasoning

Jiaqi Shang, Gabriel Kreiman, Haim Sompolinsky

机构 * Program in Neuroscience, Harvard Medical School(神经科学项目,哈佛医学院) Boston Children’s Hospital, Harvard Medical School(波士顿儿童医院,哈佛医学院) Center for Brains, Minds, and Machines(大脑、心智与机器中心) Edmond and Lily Safra Center for Brain Sciences, Hebrew University(埃德蒙与莉莉·萨弗脑科学中心,希伯来大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 27 pages, 7 figures, 8 SI figures, 2 SI tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18342 2025-07-25 cs.CV 57%

EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs

Yuping He, Yifei Huang, Guo Chen, Baoqi Pei, Jilan Xu, Tong Lu, Jiangmiao Pang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18107 2025-07-25 cs.CV 57%

T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation

Yubin Chen, Xuyang Guo, Zhenmei Shi, Zhao Song, Jiahao Zhang

机构 * San Jose State University(圣何塞州立大学) Guilin University of Electronic Technology(桂林电子科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17874 2025-07-25 cs.AI 57%

I2I-STRADA -- Information to Insights via Structured Reasoning Agent for Data Analysis

SaiBarath Sundar, Pranav Satheesan, Udayaadithya Avadhanam

机构 * Mphasis Limited(默比斯有限公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20147 2025-07-25 cs.CV 57%

FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities

Jin Wang, Yao Lai, Aoxue Li, Shifeng Zhang, Jiacheng Sun, Ning Kang, Chengyue Wu, Zhenguo Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15824 2025-07-22 cs.CV 57%

Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models

Enes Sanli, Baris Sarper Tezcan, Aykut Erdem, Erkut Erdem

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20289 2025-07-22 cs.CV 57%

VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection

Zeyi Huang, Yuyang Ji, Anirudh Sundara Rajan, Zefan Cai, Wen Xiao, Haohan Wang, Junjie Hu, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft(微软) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17768 2025-07-22 cs.CV 57%

R-Genie: Reasoning-Guided Generative Image Editing

Dong Zhang, Lingfeng He, Rui Yan, Fei Shen, Jinhui Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Code: https://dongzhang89.github.io/RGenie.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11571 2025-07-21 cs.CV 57%

VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?

Jiachen Yu, Yufei Zhan, Ziheng Wu, Yousong Zhu, Jinqiao Wang, Minghui Qiu

机构 * Tsinghua University(清华大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance China(字节跳动中国) Peng Cheng Laboratory(鹏城实验室) Wuhan AI Research(武汉人工智能研究)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03572 2025-07-21 cs.HC cs.AI cs.CL 57%

From Code to Compliance: Assessing ChatGPT's Utility in Designing an Accessible Webpage -- A Case Study

Ammar Ahmed, Margarida Fresco, Fredrik Forsberg, Hallvard Grotli

机构 * Department of Computer Science, Norwegian University of Science and Technology(计算机科学系,挪威科学技术大学) Department of Design, Norwegian University of Science and Technology(设计系,挪威科学技术大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11633 2025-07-17 cs.AI 57%

General Modular Harness for LLM Agents in Multi-Turn Gaming Environments

Yuxuan Zhang, Haoyang Yu, Lanxiang Hu, Haojian Jin, Hao Zhang

机构 * Halıcıoğlu Data Science Institute (HDSI), University of California San Diego, La Jolla, CA, USA(Halıcıoğlu数据科学研究所(HDSI),加州大学圣地亚哥分校,拉贾拉,加州,美国)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

Comments 8 pages, ICML MAS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11457 2025-07-16 cs.LG eess.IV 57%

LRMR: LLM-Driven Relational Multi-node Ranking for Lymph Node Metastasis Assessment in Rectal Cancer

Yaoxian Dong, Yifan Gao, Haoyue Li, Yanfen Cui, Xin Gao

机构 * Shanxi Province Cancer Hospital, Chinese Academy of Medical Sciences(山西省肿瘤医院、中国医学科学院) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所、中国科学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11102 2025-07-16 cs.CV 57%

KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model

Jie Yang, Wang Zeng, Sheng Jin, Lumin Xu, Wentao Liu, Chen Qian, Zhen Li, Ruimao Zhang

机构 * Sun Yat-sen University, Shenzhen(中山大学深圳校区) Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) SenseTime Research(商汤科技研究院) Chinese University of Hong Kong(香港中文大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Extended Version of KptLLM. arXiv admin note: text overlap with arXiv:2411.01846

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09910 2025-07-15 cs.CV 57%

IGD: Instructional Graphic Design with Multimodal Layer Generation

Yadong Qu, Shancheng Fang, Yuxin Wang, Xiaorui Wang, Zhineng Chen, Hongtao Xie, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) YuanShi Technology(元世科技) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09854 2025-07-15 cs.AI 57%

Model-Grounded Symbolic Artificial Intelligence Systems Learning and Reasoning with Model-Grounded Symbolic Artificial Intelligence Systems

Aniruddha Chattopadhyay, Raj Dandekar, Kaushik Roy

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Alabama(阿拉巴马大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments Accepted as paper in 19th International Conference on Neurosymbolic Learning and Reasoning,NeSy 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09374 2025-07-15 cs.AI 57%

EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique

Chenglin Zhu, Tao Zhang, Chong Li, Mingan Lin, Zenan Zhou, Jian Xie

机构 * Baichuan Inc.(北京百川科技有限公司) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 14 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00951 2025-07-15 cs.AI 57%

Thinking Beyond Tokens: From Brain-Inspired Intelligence to Cognitive Foundations for Artificial General Intelligence and its Societal Impact

Rizwan Qureshi, Ranjan Sapkota, Abbas Shah, Amgad Muneer, Anas Zafar, Ashmal Vayani, Maged Shoman, Abdelrahman B. M. Eldaly, Kai Zhang, Ferhat Sadak, Shaina Raza, Xinqi Fan, Ravid Shwartz-Ziv, Hong Yan, Vinjia Jain, Aman Chadha, Manoj Karkee, Jia Wu, Seyedali Mirjalili

机构 * Center for research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Cornell University(康奈尔大学) Department of Electronics Engineering, Mehran University of Engineering & Technology(电子工程系,工程与技术大学) Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(成像物理系,德克萨斯大学MD安德森癌症中心) Intelligent Transportation Systems, University of Tennessee(智能交通运输系统,田纳西大学) Department of Electrical Engineering, City University of Hong Kong(电气工程系,香港城市大学) Department of Mechanical Engineering, Bartin University(机械工程系,巴廷大学) Vector Institute, Toronto Canada(多伦多加拿大向量研究所) Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) Center for Data Science, New York University(数据科学中心,纽约大学) Meta Research(Meta 研究) Amazon Research(亚马逊研究) Centre for Artificial Intelligence Research and Optimization, Torrens University Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚) University Research and Innovation Center, Obuda University(研究与创新中心,奥布达大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08367 2025-07-14 cs.CV cs.SY eess.SY 57%

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment

Yuki Yoshihara, Linjing Jiang, Nihan Karatas, Hitoshi Kanamori, Asuka Harada, Takahiro Tanaka

机构 * Institutes of Innovation for Future Society, Nagoya University, Japan(面向未来的创新研究所,名古屋大学,日本)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07781 2025-07-11 cs.CV cs.RO 57%

SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes

Jiaxin Huang, Ziwen Li, Hanlve Zhang, Runnan Chen, Xiao He, Yandong Guo, Wenping Wang, Tongliang Liu, Mingming Gong

机构 * MBZUAI The University of Sydney(悉尼大学) AI2Robotic Texas A&M University(德克萨斯大学) The University of Melbourne(墨尔本大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05798 2025-07-09 cs.CV 57%

SPADE: Spatial-Aware Denoising Network for Open-vocabulary Panoptic Scene Graph Generation with Long- and Local-range Context Reasoning

Xin Hu, Ke Qin, Guiduo Duan, Ming Li, Yuan-Fang Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 Ubiquitous Intelligence and Trusted Services 重点实验室) Monash University(墨尔本大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏