arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-29 至 2025-09-29 共收录 55 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2509.22404 2025-09-29 cs.CV cs.AI 88%

RAU: Reference-based Anatomical Understanding with Vision Language Models

Yiwei Li, Yikang Liu, Jiaqi Guo, Lin Zhao, Zheyuan Zhang, Xiao Chen, Boris Mailhe, Ankush Mukherjee, Terrence Chen, Shanhui Sun

机构 * United Imaging Intelligence(联合影像智能) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22437 2025-09-29 cs.CL cs.AI 81%

Chimera: Diagnosing Shortcut Learning in Visual-Language Understanding

Ziheng Chi, Yifan Hou, Chenxi Pang, Shaobo Cui, Mubashara Akhtar, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind) EPFL(瑞士联邦理工学院)

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);grounding(abstract)

Comments Our code (https://github.com/CHIzhP/Chimera) and data (https://huggingface.co/datasets/CHIzhP/Chimera) are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09079 2025-09-29 cs.CV cs.AI 62%

VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks

Xinlong Chen, Yuanxing Zhang, Yushuo Guan, Weihong Lin, Zekun Wang, Bohan Zeng, Yang Shi, Sihan Yang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 16 篇

2509.21854 2025-09-29 cs.MM cs.CV 83%

Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization

Songjun Tu, Qichao Zhang, Jingbo Sun, Yuqian Fu, Linjing Li, Xiangyuan Lan, Dongmei Jiang, Yaowei Wang, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

Comments 12pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20890 2025-09-29 cs.CV cs.CL 83%

$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement

Zhecheng Li, Guoxian Song, Yiwei Wang, Zhen Xiong, Junsong Yuan, Yujun Cai

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) University of California, Merced(加州大学默塞德分校) University of Southern California(南加州大学) University at Buffalo(布法罗大学) The University of Queensland(昆士兰大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21874 2025-09-29 cs.LG 79%

Abductive Logical Rule Induction by Bridging Inductive Logic Programming and Multimodal Large Language Models

Yifei Peng, Yaoli Liu, Enbo Xia, Yu Jin, Wang-Zhou Dai, Zhong Ren, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) National Key Laboratory for Novel Software Technology(新型软件技术国家实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21451 2025-09-29 cs.CV cs.CL 79%

VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding

Abdul Waheed, Zhen Wu, Dareen Alharthi, Seungone Kim, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17046 2025-09-29 cs.CL cs.LG 79%

MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models

Xiaolong Wang, Zhaolu Kang, Wangyuxuan Zhai, Xinyue Lou, Yunghwei Lai, Ziyue Wang, Yawen Wang, Kaiyu Huang, Yile Wang, Peng Li, Yang Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21922 2025-09-29 cs.CV 77%

Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding

Vahid Mirjalili, Ramin Giahi, Sriram Kollipara, Akshay Kekuda, Kehui Yao, Kai Zhao, Jianpeng Xu, Kaushiki Nag, Sinduja Subramaniam, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV

Comments 4 pages, NeurIPS Workshop SpaVLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03255 2025-09-29 cs.CV 70%

DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation

Qingdong He, Jinlong Peng, Pengcheng Xu, Boyuan Jiang, Xiaobin Hu, Donghao Luo, Yong Liu, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Youtu Lab, Tencent(腾讯优图实验室) Western University(西部大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 62%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22014 2025-09-29 cs.CV cs.AI cs.HC cs.RO 62%

Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics

Saurav Jha, Stefan K. Ehrlich

机构 * SETLabs Resarch GmbH(SETL实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21871 2025-09-29 cs.CV cs.AI 62%

Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization

Boyang Liu, Yifan Hu, Senjie Jin, Shihan Dou, Gonglei Shi, Jie Shao, Tao Gui, Xuanjing Huang

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Bytedance(字节跳动)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15197 2025-09-29 cs.CV cs.AI cs.GR 62%

Intentional Gesture: Deliver Your Intentions with Gestures for Speech

Pinxin Liu, Haiyang Liu, Luchuan Song, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22228 2025-09-29 cs.CV 57%

UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective

Jun He, Yi Lin, Zilong Huang, Jiacong Yin, Junyan Ye, Yuchuan Zhou, Weijia Li, Xiang Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21774 2025-09-29 cs.CV cs.CY 57%

Training-Free Multimodal Deepfake Detection via Graph Reasoning

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Yanyan Wei, Zhangling Duan, Zhaohong Jia

机构 * School of Internet, Anhui University, Hefei, China(安徽大学互联网学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Hefei, China(合肥综合国家科学中心人工智能研究院) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(香港 Baptist 大学计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21113 2025-09-29 cs.CV 57%

MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning

Sicheng Tao, Jungang Li, Yibo Yan, Junyan Zhang, Yubo Gao, Hanqian Li, ShuHang Xun, Yuxuan Fan, Hong Chen, Jianxiang He, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) HIT(哈尔滨工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12716 2025-09-29 cs.CL cs.AI 57%

Shadow-FT: Tuning Instruct Model via Training on Paired Base Model

Taiqiang Wu, Runming Yang, Jiayi Li, Pengfei Hu, Yik-Chung Wu, Ngai Wong, Yujiu Yang

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 24 pages, 12 tables, 8 figures. Previous name: Shadow-FT: Tuning Instruct via Base

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04059 2025-09-29 cs.CL 50%

Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning

Zhilin Wang, Zhe Yang, Yun Luo, Yafu Li, Xiaoye Qu, Ziqian Qiao, Haoran Zhang, Runzhe Zhan, Derek F. Wong, Jizhe Zhou, Yu Cheng

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2509.21788 2025-09-29 cs.CV 83%

MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning

Lihao Zheng, Jiawei Chen, Xintian Shen, Hao Ma, Tao Wei

机构 * Li Auto Inc.(利亚 Auto 公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05271 2025-09-29 cs.CV 81%

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yiming Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Kaipeng Zhang, Limin Wang, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :InternVL(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23768 2025-09-29 cs.CL cs.CV 79%

Texture or Semantics? Vision-Language Models Get Lost in Font Recognition

Zhecheng Li, Guoxian Song, Yujun Cai, Zhen Xiong, Junsong Yuan, Yiwei Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) The University of Queensland(昆士兰大学) University of Southern California(南加州大学) University at Buffalo(布法罗大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21356 2025-09-29 cs.CV cs.AI 73%

Phrase-grounded Fact-checking for Automatically Generated Chest X-ray Reports

Razi Mahmood, Diego Machado-Reyes, Joy Wu, Parisa Kaviani, Ken C. L. Wong, Niharika D'Souza, Mannudeep Kalra, Ge Wang, Pingkun Yan, Tanveer Syeda-Mahmood

机构 * Rensselaer Polytechnic Institute, NY, USA(罗文学院) IBM Research, Almaden, CA, USA(IBM研究院) Stanford University, CA, USA(斯坦福大学) Massachusetts General Hospital (MGH), Boston, USA(麻省总医院)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments In proceedings MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03334 2025-09-29 cs.CV cs.DB 70%

OS-W2S: An Automatic Labeling Engine for Language-Guided Open-Set Aerial Object Detection

Guoting Wei, Yu Liu, Xia Yuan, Xizhe Xue, Linlin Guo, Yifan Yang, Chunxia Zhao, Zongwen Bai, Haokui Zhang, Rong Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Intellifusion Inc.(Intellifusion公司) Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室) Yan’an University(延安大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12881 2025-09-29 cs.CL 67%

TEXT2AFFORD: Probing Object Affordance Prediction abilities of Language Models solely from Text

Sayantan Adak, Daivik Agrawal, Animesh Mukherjee, Somak Aditya

机构 * IIT, Kharagpur(印度Kharagpur理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments Accepted at Conference on Computational Natural Language Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22019 2025-09-29 cs.CV 57%

EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking

Yuki Sakai, Ryosuke Furuta, Juichun Yen, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to the I-HFM Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21367 2025-09-29 cs.CR cs.AI 57%

Design and Implementation of a Secure RAG-Enhanced AI Chatbot for Smart Tourism Customer Service: Defending Against Prompt Injection Attacks -- A Case Study of Hsinchu, Taiwan

Yu-Kai Shih, You-Kai Kang

机构 * Department of Information Management, National Dong Hwa University(信息管理系,国立东华大学) By The Student (BTS) Experimental Education Program (Non-School Type)(学生(BTS)实验教育计划(非学校类型))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21978 2025-09-29 cs.CL 50%

MotivGraph-SoIQ: Integrating Motivational Knowledge Graphs and Socratic Dialogue for Enhanced LLM Ideation

Xinping Lei, Tong Zhou, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems(认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hunan Provincial Key Laboratory of Philosophy and Social Sciences of Artificial Intelligence and Precision International, Hunan Normal University(湖南省人工智能与精准哲学社会科学省级重点实验室,湖南师范大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2412.04041 2025-09-29 cs.CE 78%

StockGenChaR: A Study on the Evaluation of Large Vision-Language Models on Stock Chart Captioning

Le Qiu, Emmanuele Chersoni

专题命中 文档图表理解 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 6 篇

2509.22644 2025-09-29 cs.CL cs.AI 70%

WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Junting Pan, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab)(多媒体实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏