arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2508.06220 2025-08-14 cs.CL cs.AI 70%

InfoCausalQA:Can Models Perform Non-explicit Causal Reasoning Based on Infographic?

Keummin Ka, Junhyeong Park, Jaehyun Jeon, Youngjae Yu

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07626 2025-08-12 cs.CV cs.RO 70%

AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning

Dejie Yang, Zijing Zhao, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16805 2025-08-12 cs.CV 70%

Co-VisiON: Co-Visibility ReasONing on Sparse Image Sets of Indoor Scenes

Chao Chen, Nobel Dang, Juexiao Zhang, Wenkai Sun, Pengfei Zheng, Xuhang He, Yimeng Ye, Jiasheng Zhang, Taarun Srinivas, Chen Feng

机构 * New York University(纽约大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05405 2025-08-08 cs.AI 70%

DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Zhiming Ding, Bo Zheng

机构 * 1 Taobao \& Tmall Group of Alibaba, 2 Institute of Software, Chinese Academy of Science, 3 University of Chinese Academy of Sciences, 4 Renmin University of China, 5 Informatics Department, PUC-Rio

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.AI

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05234 2025-08-08 cs.CL cs.AI 70%

Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation

Haonan Shangguan, Xiaocui Yang, Shi Feng, Daling Wang, Yifei Zhang, Ge Yu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04625 2025-08-07 cs.CV cs.CE 70%

FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging

Zichen Tang, Haihong E, Jiacheng Liu, Zhongjun Yang, Rongjin Li, Zihua Rong, Haoyang He, Zhuodi Hao, Xinyang Hu, Kun Ji, Ziyan Ma, Mengyuan Ji, Jun Zhang, Chenghao Ma, Qianhe Zheng, Yang Liu, Yiling Huang, Xinyi Hu, Qing Huang, Zijian Xie, Shiyao Peng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. arXiv admin note: text overlap with arXiv:2311.06602 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04453 2025-08-07 cs.CV 70%

Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion

Qingguo Hu, Ante Wang, Jia Song, Delai Qiu, Qingsong Liu, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Xiamen Unisound Intelligence Technology Co., Ltd(厦门Unisound智能科技有限公司) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00356 2025-08-04 cs.CV cs.MA 70%

Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning

Angelos Vlachos, Giorgos Filandrianos, Maria Lymperaiou, Nikolaos Spanos, Ilias Mitsouras, Vasileios Karampinis, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory, National Technical University of Athens(人工智能与学习系统实验室,国家技术大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22074 2025-07-31 cs.LG cs.CL 70%

CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs

Yangshu Yuan, Heng Chen, Xinyi Jiang, Christian Ng, Kexin Qiu

机构 * Singapore Institute of Management(新加坡管理学院)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21917 2025-07-30 cs.CV 70%

ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval

Nicola Fanelli, Gennaro Vessio, Giovanna Castellano

机构 * Department of Computer Science University of Bari Aldo Moro(计算机科学系巴里大学Aldo Moro)

专题命中 视觉推理 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12499 2025-07-18 cs.RO cs.LG 70%

ReAL-AD: Towards Human-Like Reasoning in End-to-End Autonomous Driving

Yuhang Lu, Jiadong Tu, Yuexin Ma, Xinge Zhu

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15804 2025-07-11 cs.CV 70%

STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs

Zongzhao Li, Zongyang Ma, Mingze Li, Songyou Li, Yu Rong, Tingyang Xu, Ziqi Zhang, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) DAMO Academy, Alibaba Group, Hangzhou, China(阿里云达摩院) Hupan Lab, Hangzhou, China(杭州华普实验室)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08617 2025-07-10 cs.CV 70%

OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning

Zhaochen Su, Linjie Li, Mingyang Song, Yunzhuo Hao, Zhengyuan Yang, Jun Zhang, Guanjie Chen, Jiawei Gu, Juntao Li, Xiaoye Qu, Yu Cheng

机构 * Soochow University(苏州大学) Microsoft(微软) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04670 2025-07-10 cs.CV 70%

Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs

Yikang Zhou, Tao Zhang, Shilin Xu, Shihao Chen, Qianyu Zhou, Yunhai Tong, Shunping Ji, Jiangning Zhang, Lu Qi, Xiangtai Li

机构 * Wuhan University(武汉大学) Bytedance Seed(字节跳动种子) Peking University(北京大学) Zhejiang University(浙江大学) SJTU(上海交通大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05934 2025-07-09 cs.AI 70%

BlueLM-2.5-3B Technical Report

Baojiao Xiong, Boheng Chen, Chengzhi Wang, Daxiong Luo, Dongsheng Xu, Dongyang Liu, Fan Yang, Fangyuan Li, Fei Teng, Feng Wang, Fukang Qin, Fuquan Peng, Guanxin Tan, Guozhi Wang, Haibo Yu, Haohao Gao, Heng Liu, Hongbo Yang, Hongjian Zou, Houzheng Shen, Hu Meng, Huan Li, Hui Tan, Jiali Chen, Jianzhao Chen, Jinliang Zhu, Kai Wang, Lei Wu, Liangbing Liu, Liuyang Bian, Liyan He, Long Liu, Peiwen Li, Penggang Shi, Qi Ding, Rui Hu, Shuai Cao, Shuai Ren, Shuang Peng, Teng Xie, Weiji Chen, Weilin Xiang, Weixin Wu, Xi Yin, Xiaoxin Chen, Xu Chen, Yafei Wen, Yan Hu, Yanzhou Yang, Yina Xie, Yinghao Chen, Yixuan Liao, Yu Geng, Yuanjiang Ouyang, Yuanzhuo Yang, Yuehua He, Yushuai Peng, Zhaoxiong Wang, Zheng Wang, Zhibo Zhou, Ziyang Wu

机构 * vivo AI Lab(vivo人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05259 2025-07-08 cs.CV 70%

Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing

Chun-Hsiao Yeh, Yilin Wang, Nanxuan Zhao, Richard Zhang, Yuheng Li, Yi Ma, Krishna Kumar Singh

机构 * UC Berkeley(伯克利大学) HKU(香港大学) Adobe(Adobe公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://danielchyeh.github.io/x-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04699 2025-07-08 cs.CV 70%

A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets

Zexi Jia, Chuanwei Huang, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Ying Deng, Jiapei Zhang, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc, China(腾讯公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04451 2025-07-08 cs.CV 70%

CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step

Zheyuan Liu, Munan Ning, Qihui Zhang, Shuo Yang, Zhongrui Wang, Yiwei Yang, Xianzhe Xu, Yibing Song, Weihua Chen, Fan Wang, Li Yuan

机构 * School of Electrical and Computer Engineering, Peking University(北京大学电子工程学院) Hupan Lab(鸿篇实验室) DAMO Academy, Alibaba Group(阿里云达摩院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20129 2025-07-08 cs.CV cs.GR 70%

Agentic 3D Scene Generation with Spatially Contextualized VLMs

Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Project page: https://spatctxvlm.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15251 2025-07-08 cs.CL cs.AI 70%

AgentPS: Agentic Process Supervision for Content Moderation with Multimodal LLMs

Mingchao Liu, Yu Sun, Ruixiao Sun, Xin Dong, Xiang Shen, Hongyu Xiong

机构 * TikTok, Inc.(字节跳动公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01376 2025-07-03 cs.AI 70%

AI Agents and Agentic AI-Navigating a Plethora of Concepts for Future Manufacturing

Yinwang Ren, Yangyang Liu, Tang Ji, Xun Xu

机构 * Department of Mechanical and Mechatronics Engineering, Faculty of Engineering and Design, University of Auckland(机械与机电工程系,工程与设计学院,奥克兰大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments Submitted to JMS(March 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21101 2025-06-27 cs.CV 70%

OracleFusion: Assisting the Decipherment of Oracle Bone Script with Structurally Constrained Semantic Typography

Caoshuo Li, Zengmao Ding, Xiaobin Hu, Bang Li, Donghao Luo, AndyPian Wu, Chaoyang Wang, Chengjie Wang, Taisong Jin, SevenShu, Yunsheng Wu, Yongge Liu, Rongrong Ji

机构 * Xiamen University(厦门大学) Tencent(腾讯) Anyang Normal University(安阳师范学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18512 2025-06-25 eess.IV cs.CL cs.CV q-bio.QM 70%

MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis

Yuting Zhang, Kaishen Yuan, Hao Lu, Yutao Yue, Jintai Chen, Kaishun Wu

机构 * The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18564 2025-06-24 cs.CV 70%

VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning

Xuanyu Zhang, Weiqi Li, Shijie Zhao, Junlin Li, Li Zhang, Jian Zhang

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18234 2025-06-24 cs.CV cs.RO 70%

Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning

Yue Li, Meng Tian, Dechang Zhu, Jiangtong Zhu, Zhenyu Lin, Zhiwei Xiong, Xinhai Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17545 2025-06-24 cs.CV 70%

Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations

Zhihao Yuan, Shuyi Jiang, Chun-Mei Feng, Yaolun Zhang, Shuguang Cui, Zhen Li, Na Zhao

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,香港科技大学)

专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13762 2025-06-17 cs.RO cs.CV 70%

Touch begins where vision ends: Generalizable policies for contact-rich manipulation

Zifan Zhao, Siddhant Haldar, Jinda Cui, Lerrel Pinto, Raunaq Bhirangi

机构 * New York University Shanghai(纽约大学上海分校) New York University(纽约大学) Honda Research(本田研究)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00868 2025-06-17 cs.MM cs.CV 70%

Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations

Parul Gupta, Shreya Ghosh, Tom Gedeon, Thanh-Toan Do, Abhinav Dhall

机构 * Monash University(墨尔本大学) Curtin University(Curtin大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08429 2025-06-11 cs.CV 70%

Better Reasoning with Less Data: Enhancing VLMs Through Unified Modality Scoring

Mingjie Xu, Andrew Estornell, Hongzheng Yang, Yuzhi Zhao, Zhaowei Zhu, Qi Xuan, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) BIAI-ZJUT Zhejiang University of Technology(浙江工业大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏