arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-22 至 2025-09-22 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2508.05244 2025-09-22 cs.CV cs.AI 73%

RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding

Tianchen Fang, Guiru Liu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Upon further review, we identified that our dataset requires optimization to ensure research reliability and accuracy. Additionally, considering the target journal's latest submission policies, we believe comprehensive manuscript revisions are necessary

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2509.16087 2025-09-22 cs.CV cs.AI 84%

See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model

Pengteng Li, Pinhao Song, Wuyang Li, Weiyu Guo, Huizai Yao, Yijie Xu, Dugang Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) KU Leuven(比利时鲁文大学) EPFL(苏黎世联邦理工学院) SZU(深圳大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16149 2025-09-22 cs.CV 83%

Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Models

Renjie Pi, Kehao Miao, Li Peihang, Runtao Liu, Jiahui Gao, Jipeng Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) HKU(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15772 2025-09-22 cs.CV 83%

Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation

Weimin Bai, Yubo Li, Weijian Luo, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 视觉推理 :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20587 2025-09-22 cs.LG 83%

Cache-of-Thought: Master-Apprentice Framework for Cost-Effective Vision Language Model Reasoning

Mingyuan Wu, Jize Jiang, Haozhen Zheng, Meitang Li, Zhaoheng Li, Beitong Tian, Bo Chen, Yongjoo Park, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.LG

Comments EMNLP 2025 Main Conference. Mingyuan, Jize, and Haozhen contributed equally, while Minjia, Chengxiang, and Klara advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16127 2025-09-22 cs.CV 70%

BaseReward: A Strong Baseline for Multimodal Reward Model

Yi-Fan Zhang, Haihua Yang, Huanyu Zhang, Yang Shi, Zezhou Chen, Haochen Tian, Chaoyou Fu, Haotian Wang, Kai Wu, Bo Cui, Xu Wang, Jianfei Pan, Haotian Wang, Zhang Zhang, Liang Wang

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) NJU(南京大学) PKU(北京大学) THU(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15661 2025-09-22 cs.SD cs.AI cs.CL eess.AS 70%

SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models

Qiaolin Wang, Xilin Jiang, Linyang He, Junkai Wu, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15490 2025-09-22 cs.CV cs.AI 62%

SmolRGPT: Efficient Spatial Reasoning for Warehouse Environments with 600M Parameters

Abdarahmane Traore, Éric Hervet, Andy Couturier

机构 * Embia, Computer Science Department, Faculty of Science, Université de Moncton(Embia计算机科学系,科学学院,蒙特龙大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 3 figures, IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03642 2025-09-22 cs.CV cs.AI 62%

Spatial Understanding from Videos: Structured Prompts Meet Simulation Data

Haoyu Zhang, Meng Liu, Zaijing Li, Haokun Wen, Weili Guan, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15464 2025-09-22 cs.LG 57%

Temporal Reasoning with Large Language Models Augmented by Evolving Knowledge Graphs

Junhong Lin, Song Wang, Xiaojie Guo, Julian Shun, Yada Zhu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) University of Virginia(弗吉尼亚大学) IBM Research(IBM研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15717 2025-09-22 cs.RO 50%

Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference

Haoran Ding, Anqing Duan, Zezhou Sun, Dezhen Song, Yoshihiko Nakamura

机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 视觉推理 :visual reasoning(abstract)

Comments Submitted to IEEE for possible publication, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2509.15532 2025-09-22 cs.CV cs.AI 81%

GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents

Xianhang Ye, Yiqing Li, Wei Dai, Miancan Liu, Ziyuan Chen, Zhangye Han, Hongbo Min, Jinkui Ren, Xiantao Zhang, Wen Yang, Zhi Jin

机构 * Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) East China Normal University(华东师范大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15243 2025-09-22 cs.CV 79%

Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models

Muhammad Imran, Yugyung Lee

机构 * Computer Science, School of Science and Engineering, University of Missouri - Kansas City(计算机科学系,科学与工程学院,密苏里大学-堪萨斯城分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures, 3 tables

Journal ref Non-Archival track - The First Workshop on Multimodal Knowledge and Language Modeling IJCAI 2025 Workshop, August 16, 2025 IJCAI 2025 Workshop, August 16, 2025 Room 516B, Palais des congrès, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15837 2025-09-22 cs.CL 78%

The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders

Adrian Sauter, Willem Zuidema, Marianne de Heer Kloots

机构 * Institute for Logic, Language and Computation(逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments 5 pages, 3 figures, Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13794 2025-09-22 cs.CV cs.AI 73%

LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation

Yang Zhou, Shiyu Zhao, Yuxiao Chen, Zhenting Wang, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15476 2025-09-22 cs.CL cs.MM 71%

Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding

Zhu Li, Xiyuan Gao, Yuqing Zhang, Shekhar Nayak, Matt Coler

机构 * University of Groningen, The Netherlands(Groningen大学,荷兰)

专题命中 视觉定位与Grounding :multimodal large language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14967 2025-09-22 cs.RO cs.HC 67%

Affordance-Based Disambiguation of Surgical Instructions for Collaborative Robot-Assisted Surgery

Ana Davila, Jacinto Colan, Yasuhisa Hasegawa

机构 * Nagoya University, Japan(名古屋大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments To be presented at the 1st Workshop on Intelligent Cobodied Assistance and Robotic Empowerment (iCARE). 2025 Conference on Robot Learning (CoRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14312 2025-09-22 cs.CV 57%

CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation

Marc Lafon, Gustavo Adolfo Vargas Hakim, Clément Rambour, Christian Desrosier, Nicolas Thome

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺学院) Sorbonne Université(索邦大学) ETS Montreal(蒙特利尔ETS) Institut universitaire de France(法国国家科学研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Journal ref 39th Conference on Neural Information Processing Systems, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01029 2025-09-22 cs.CY cs.AI cs.DB cs.HC 57%

Who is Responsible When AI Fails? Mapping Causes, Entities, and Consequences of AI Privacy and Ethical Incidents

Hilda Hadan, Reza Hadi Mogavi, Leah Zhang-Kennedy, Lennart E. Nacke

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 63 pages, 7 tables, 7 figures

Journal ref International Journal of Human-Computer Interaction (2025): 1-45

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2509.15432 2025-09-22 cs.IR 50%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2509.14172 2025-09-22 cs.LG cs.AI 62%

TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning

Ziyuan Chen, Zhenghui Zhao, Zhangye Han, Miancan Liu, Xianhang Ye, Yiqing Li, Hongbo Min, Jinkui Ren, Xiantao Zhang, Guitao Cao

机构 * East China Normal University(东华大学) Alibaba Group(阿里巴巴集团) University of Electronic Science and Technology of China(电子科技大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15937 2025-09-22 cs.RO cs.AI 57%

A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Fuxian Huang, Haoran Zhang, Ming Zhou, Shengzhe Zhang, Litao Liu, Sixu Lin, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :InternVL(abstract);分类 cs.AI

Comments 26 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15738 2025-09-22 cs.LG 57%

GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning

Musen Lin, Minghao Liu, Taoran Lu, Lichen Yuan, Yiwei Liu, Haonan Xu, Yu Miao, Yuhao Chao, Zhaojian Li

机构 * ByteDance(字节跳动) UCAS(北京大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15221 2025-09-22 cs.CV 57%

ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data

Zhaoyang Liu, Jingjing Xie, Zichen Ding, Zehao Li, Bowen Yang, Zhenyu Wu, Xuehui Wang, Qiushi Sun, Shi Liu, Weiyun Wang, Shenglong Ye, Qingyun Li, Xuan Dong, Yue Yu, Chenyu Lu, YunXiang Mo, Yao Yan, Zeyue Tian, Xiao Zhang, Yuan Huang, Yiqian Liu, Weijie Su, Gen Luo, Xiangyu Yue, Biqing Qi, Kai Chen, Bowen Zhou, Yu Qiao, Qifeng Chen, Wenhai Wang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 5 篇

2509.16163 2025-09-22 cs.CV cs.AI cs.CL 84%

Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks

Het Patel, Muzammil Allie, Qian Zhang, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments To be presented as a poster at the Workshop on Safe and Trustworthy Multimodal AI Systems (SafeMM-AI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15361 2025-09-22 cs.CL cs.AI cs.MM 79%

Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing

Zichen Wu, Hsiu-Yuan Huang, Yunfang Wu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) MOE Key Laboratory of Computational Linguistics, Peking University(北京大学教育部计算语言学重点实验室) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学国家多媒体信息处理重点实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16088 2025-09-22 cs.LG 74%

Randomized Smoothing Meets Vision-Language Models

Emmanouil Seferis, Changshun Wu, Stefanos Kollias, Saddek Bensalem, Chih-Hong Cheng

机构 * National Technical University of Athens(希腊雅典国家技术大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CSX-AI(CSX-AI公司) Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.LG

Comments EMNLP'25 full version, including appendix (proofs, additional experiments)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15803 2025-09-22 cs.CV cs.AI 73%

CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models

Fangjian Shen, Zifeng Liang, Chao Wang, Wushao Wen

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangzhou, China(工程学院,中山大学,广州,中国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 7 figures, submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07620 2025-09-22 cs.CV 57%

ViLU: Learning Vision-Language Uncertainties for Failure Prediction

Marc Lafon, Yannis Karmim, Julio Silva-Rodríguez, Paul Couairon, Clément Rambour, Raphaël Fournier-Sniehotta, Ismail Ben Ayed, Jose Dolz, Nicolas Thome

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Journal ref International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 8 篇

2506.13638 2025-09-22 cs.CV cs.AI 84%

DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models

Zhiyi Shi, Binjie Wang, Chongjie Si, Yichen Wu, Junsik Kim, Hanspeter Pfister

机构 * Harvard University(哈佛大学) City University of Hong Kong(香港城市大学) Amazon(亚马逊) Fudan University(复旦大学) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能关键实验室,上海交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏