arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-20 至 2025-10-20 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2510.13253 2025-10-20 cs.CV cs.AI cs.LG 67%

End-to-End Multi-Modal Diffusion Mamba

Chunhao Lu, Qiang Lu, Meichen Dong, Jake Luo

机构 * China University of Petroleum-Beijing(中国石油大学(北京)) Leyard Optoelectronic(莱亚德光电) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2509.13031 2025-10-20 cs.CV cs.AI 88%

Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models

Yan Chen, Long Li, Teng Xi, Long Zeng, Jingdong Wang

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17092 2025-10-20 cs.CV cs.CL 85%

Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI

Syed Abdul Gaffar Shakhadri, Kruthika KR, Kartik Basavaraj Angadi

机构 * SandLogic Technologies Pvt Ltd(沙德逻辑技术 Pvt Ltd)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15841 2025-10-20 cs.CV 70%

Neuro-Symbolic Spatial Reasoning in Segmentation

Jiayi Lin, Jiabo Huang, Shaogang Gong

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15162 2025-10-20 cs.CV cs.CL 70%

Train a Unified Multimodal Data Quality Classifier with Synthetic Data

Weizhi Wang, Rongmei Lin, Shiyang Li, Colin Lockard, Ritesh Sarkhel, Sanket Lokegaonkar, Jingbo Shang, Xifeng Yan, Nasser Zalmout, Xian Li

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Amazon Stores Foundational AI(亚马逊商店基础人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10248 2025-10-20 cs.LG cs.AI 62%

Reasoning-Enhanced Large Language Models for Molecular Property Prediction

Jiaxi Zhuang, Yaorui Shi, Jue Hou, Yunong He, Mingwei Ye, Mingjun Xu, Yuming Su, Linfeng Zhang, Ying Qian, Linfeng Zhang, Guolin Ke, Hengxing Cai

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01055 2025-10-20 cs.AI cs.CL cs.CV 62%

VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use

Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, Tianyu Pang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Sea AI Lab(Sea AI 实验室) University of Toronto(多伦多大学) Shanghai University(上海大学) HKUST(香港科技大学) M-A-P National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 32 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17462 2025-10-20 cs.RO cs.AI cs.CV 62%

General-Purpose Robotic Navigation via LVLM-Orchestrated Perception, Reasoning, and Acting

Bernard Lange, Anil Yildiz, Mansur Arief, Shehryar Khattak, Mykel Kochenderfer, Georgios Georgakis

机构 * Stanford University(斯坦福大学) Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07176 2025-10-20 cs.MA cs.AI 57%

Internet of Agents: Fundamentals, Applications, and Challenges

Yuntao Wang, Shaolong Guo, Yanghe Pan, Zhou Su, Fahao Chen, Tom H. Luan, Peng Li, Jiawen Kang, Dusit Niyato

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(网络安全科学与工程学院,西安交通大学) School of Artificial Intelligence, Shandong University(人工智能学院,山东大学) School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 25 pages,10 figures, 10 tables. Accepted by IEEE TCCN in Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03409 2025-10-20 cs.CV 57%

PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation

Ao Wang, Hui Chen, Jiaxin Li, Jianchao Tan, Kefeng Zhang, Xunliang Cai, Zijia Lin, Jungong Han, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15421 2025-10-20 cs.CL 50%

When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs

Hongcheng Liu, Pingjie Wang, Yuhao Wang, Siqu Ou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 3 篇

2510.15866 2025-10-20 cs.CV cs.NE 83%

BiomedXPro: Prompt Optimization for Explainable Diagnosis with Biomedical Vision Language Models

Kaushitha Silva, Mansitha Eashwara, Sanduni Ubayasiri, Ruwan Tennakoon, Damayanthi Herath

机构 * University of Peradeniya(珀德尼亚大学) RMIT University(皇家墨尔本理工大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 10 Pages + 15 Supplementary Material Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13564 2025-10-20 cs.CV cs.AI 62%

HumorDB: Can AI understand graphical humor?

Vedaant Jain, Felipe dos Santos Alves Feitosa, Gabriel Kreiman

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of São Paulo(圣保罗大学) Harvard Medical School(哈佛医学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 10 main figures, 4 additional appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04232 2025-10-20 cs.LG 57%

Rethinking Layer-wise Gaussian Noise Injection: Bridging Implicit Objectives and Privacy Budget Allocation

Qifeng Tan, Shusen Yang, Xuebin Ren, Yikai Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Errors were found in the experimental data preprocessing, which affected the reported results and conclusions. The paper is being revised and a corrected version will be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2505.19312 2025-10-20 cs.IR 50%

DocMMIR: A Framework for Document Multi-modal Information Retrieval

Zirui Li, Siwei Wu, Yizhi Li, Xingyu Wang, Yi Zhou, Chenghua Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted for publication at EMNLP 2025 Findings. Code and data publicly available at https://github.com/J1mL1/DocMMIR

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2505.11717 2025-10-20 cs.LG cs.AI cs.CL cs.CV 67%

WebInject: Prompt Injection Attack to Web Agents

Xilong Wang, John Bloch, Zedian Shao, Yuepeng Hu, Shuyan Zhou, Neil Zhenqiang Gong

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19983 2025-10-20 cs.RO cs.AI 57%

CLASP: General-Purpose Clothes Manipulation with Semantic Keypoints

Yuhong Deng, Chao Tang, Cunjun Yu, Linfeng Li, David Hsu

机构 * School of Computing, Smart System Institute, National University of Singapore, Singapore(计算学院、智能系统研究所、新加坡国立大学,新加坡) Department of Electronic and Electrical Engineering, Southern University of Science and Technology, China(电子与电气工程系、南方科技大学,中国)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07299 2025-10-20 cs.RO cs.CV 57%

MLFM: Multi-Layered Feature Maps for Richer Language Understanding in Zero-Shot Semantic Navigation

Sonia Raychaudhuri, Enrico Cancelli, Tommaso Campari, Lamberto Ballan, Manolis Savva, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·克塞勒基金会) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2510.09473 2025-10-20 cs.CV cs.LG 81%

D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models

Jisu Han, Wonjun Hwang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15068 2025-10-20 cs.CR cs.AI 79%

Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling

Deyue Zhang, Dongdong Yang, Junjie Mu, Quancheng Zou, Zonghao Ying, Wenzhuo Xu, Zhao Liu, Xuan Wang, Xiangzheng Zhang

机构 * AI Security Lab(360人工智能安全实验室) Politecnico di Milano(米兰理工大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15543 2025-10-20 cs.CL cs.AI cs.IR cs.MM 57%

MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval

Qiyu Wu, Shuyang Cui, Satoshi Hayakawa, Wei-Yao Wang, Hiromi Wakaki, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2510.09607 2025-10-20 cs.CV 83%

VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation

Shaoqi Dong, Chaoyou Fu, Haihan Gao, Yi-Fan Zhang, Chi Yan, Chu Wu, Xiaoyu Liu, Yunhang Shen, Jing Huo, Deqiang Jiang, Haoyu Cao, Yang Gao, Xing Sun, Ran He, Caifeng Shan

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Homepage: https://ltbai.github.io/VITA-VLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23379 2025-10-20 cs.CL cs.AI cs.CV 73%

CCD: Mitigating Hallucinations in Radiology MLLMs via Clinical Contrastive Decoding

Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Preprint, 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01842 2025-10-20 cs.LG cs.AI 62%

GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping

Qifu Wen, Xi Zeng, Zihan Zhou, Shuaijun Liu, Mehdi Hosseinzadeh, Ningxin Su, Reza Rawassizadeh

机构 * Department of Computer Science, Boston University Metropolitan College(波士顿大学计算机科学系) Information Hub, The Hong Kong University of Science and Technology, Guangzhou(香港科技大学广州信息中心) School of Engineering and Technology, Duy Tan University, Da Nang, Vietnam(杜益大学工程科技学院,岘港,越南) Department of AI, School of Computer Science and Engineering, Galgotias University, Greater Noida, India(加洛吉亚大学人工智能系,诺伊达,印度)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12974 2025-10-20 cs.CV 57%

Scope: Selective Cross-modal Orchestration of Visual Perception Experts

Tianyu Zhang, Suyuchen Wang, Chao Wang, Juan Rodriguez, Ahmed Masry, Xiangru Jian, Yoshua Bengio, Perouz Taslakian

机构 * ServiceNow Université de Montréal(蒙特利尔大学) École de Technologie Supérieure(高级技术学院) University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) York University(约克大学) CIFAR AI Chair(CIFAR人工智能主席) Mila Law Zero

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09585 2025-10-20 cs.CV 57%

Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation

Jitesh Jain, Zhengyuan Yang, Humphrey Shi, Jianfeng Gao, Jianwei Yang

机构 * Microsoft Research, Redmond(微软研究院(红mond)) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Project Page: https://praeclarumjj3.github.io/visper_lm/

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 1 篇

2502.17669 2025-10-20 cs.CL 50%

Towards Human Cognition: Visual Context Guides Syntactic Priming in Fusion-Encoded Models

Bushi Xiao, Michael Bennie, Jayetri Bardhan, Daisy Zhe Wang

机构 * University of Florida(佛罗里达大学)

专题命中 其他VLM :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏