arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-30 至 2025-09-30 共收录 101 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2506.06610 2025-09-30 math.GM 50%

Mirror Duality in a Spencer-Type Complex: Analytic and Riemann-Roch Perspectives

Dongzhe Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2509.22186 2025-09-30 cs.CV cs.CL 79%

MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing

Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Yuanhong Zheng, Dongsheng Ma, Zirui Tang, Boyu Niu, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Jingzhou Chen, Fangdong Wang, Xiaomeng Zhao, Liqun Wei, Wei Li, Shasha Wang, Ruiliang Xu, Yuanyuan Cao, Lu Chen, Qianqian Wu, Huaiyu Gu, Lindong Lu, Keming Wang, Dechen Lin, Guanlin Shen, Xuanhe Zhou, Linfeng Zhang, Yuhang Zang, Xiaoyi Dong, Jiaqi Wang, Bo Zhang, Lei Bai, Pei Chu, Weijia Li, Jiang Wu, Lijun Wu, Zhenxiang Li, Guangyu Wang, Zhongying Tu, Chao Xu, Kai Chen, Yu Qiao, Bowen Zhou, Dahua Lin, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

Comments Technical Report; GitHub Repo: https://github.com/opendatalab/MinerU Hugging Face Model: https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B Hugging Face Demo: https://huggingface.co/spaces/opendatalab/MinerU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23883 2025-09-30 cs.CL cs.IR 50%

DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning

Yibo Yan, Guangwei Xu, Xin Zou, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 文档图表理解 :vision-language model(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 13 篇

2509.24917 2025-09-30 cs.RO cs.LG 83%

From Code to Action: Hierarchical Learning of Diffusion-VLM Policies

Markus Peschl, Pietro Mazzaglia, Daniel Dijkman

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG

Comments 19 pages including references, 6 figures. Accepted to CoRL LEAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23517 2025-09-30 cs.CV cs.AI 76%

Evaluating point-light biological motion in multimodal large language models

Akila Kadambi, Marco Iacoboni, Lisa Aziz-Zadeh, Srini Narayanan

机构 * Psychiatry and Biobehavioral Sciences, UCLA(乌尔拉克大学精神病学与生物行为科学系) Brain and Creativity Institute, USC(美国大学脑与创造力研究所) Google DeepMind, Zurich(谷歌深度Mind瑞士分公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23866 2025-09-30 cs.LG cs.AI cs.CV 75%

Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation

Pengxiang Li, Zechen Hu, Zirui Shang, Jingrong Wu, Yang Liu, Hui Liu, Zhi Gao, Chenrui Shi, Bofei Zhang, Zihao Zhang, Xiaochuan Shi, Zedong YU, Yuwei Wu, Xinxiao Wu, Yunde Jia, Liuyu Xiang, Zhaofeng He, Qing Li

机构 * Beijing Institute of Technology(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) DataCanvas Beijing University of Posts and Telecommunications(北京邮电大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24183 2025-09-30 cs.CL cs.AI cs.LG 73%

Retrieval-augmented GUI Agents with Generative Guidelines

Ran Xu, Kaixin Ma, Wenhao Yu, Hongming Zhang, Joyce C. Ho, Carl Yang, Dong Yu

机构 * Emory University(埃默里大学) Tencent AI Lab(腾讯AI实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25047 2025-09-30 cs.AI 70%

Scaling Synthetic Task Generation for Agents via Exploration

Ram Ramrakhya, Andrew Szot, Omar Attia, Yuhao Yang, Anh Nguyen, Bogdan Mazoure, Zhe Gan, Harsh Agrawal, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08052 2025-09-30 cs.CV cs.RO 70%

ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

Yongkang Li, Kaixin Xiong, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23655 2025-09-30 cs.RO cs.AI cs.CV cs.LG 67%

Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models

Rokas Bendikas, Daniel Dijkman, Markus Peschl, Sanjay Haresh, Pietro Mazzaglia

机构 * Centre for Artificial Intelligence, UCL(人工智能中心,伦敦大学学院) Qualcomm AI Research(高通人工智能研究)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Presented at 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23563 2025-09-30 cs.RO cs.AI cs.CV cs.LG 67%

RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation

Seungchan Kim, Omar Alama, Dmytro Kurdydyk, John Keller, Nikhil Keetha, Wenshan Wang, Yonatan Bisk, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Davidson College(戴维森学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17144 2025-09-30 cs.CV cs.AI cs.LG 67%

Do We Need Large VLMs for Spotting Soccer Actions?

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Avijit Dasgupta, Sandeep Chaurasia

机构 * Manipal University Jaipur(贾浦尔曼普尔大学) UNC–Charlotte(北卡罗来纳州立大学夏洛特分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 6 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24219 2025-09-30 cs.RO cs.AI cs.LG 62%

ViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot Learning

Tomoyuki Kagaya, Subramanian Lakshmi, Anbang Ye, Thong Jing Yuan, Jayashree Karlekar, Sugiri Pranata, Natsuki Murakami, Akira Kinose, Yang You

机构 * Panasonic Connect Co., Ltd.(松下电器(株式会社)) Panasonic R&D Center(松下研发中心) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24768 2025-09-30 cs.RO 50%

IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks

Eric Hannus, Miika Malin, Tran Nguyen Le, Ville Kyrki

机构 * Intelligent Robotics Group at the Department of Electrical Engineering and Automation, School of Electrical Engineering, Aalto University(Aalto大学电气工程学院电气工程与自动化系智能机器人组) Biomimetics and Intelligent Systems Group at the Faculty of Information Technology and Electrical Engineering, University of Oulu(奥卢大学信息科技与电气工程学院仿生学与智能系统组) Section of Mechanical Technology at the Department of Engineering Technology and Didactics, Technical University of Denmark(丹麦技术大学工程技术与教学系机械技术部门)

专题命中 GUI与屏幕智能体 :vision language model(abstract)

Comments Under review for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24387 2025-09-30 cs.RO 50%

AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation

Xin Ding, Jianyu Wei, Yifan Yang, Shiqi Jiang, Qianxi Zhang, Hao Wu, Fucheng Jia, Liang Mi, Yuxuan Yan, Weijun Wang, Yunxin Liu, Zhibo Chen, Ting Cao

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Central South University(中南大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19391 2025-09-30 cs.RO 50%

LaVA-Man: Learning Visual Action Representations for Robot Manipulation

Chaoran Zhu, Hengyi Wang, Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 9 篇

2505.15367 2025-09-30 cs.CV cs.AI cs.CL 84%

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition

Dasol Choi, Seunghyun Lee, Youngsook Song

机构 * AIM Intelligence(AIM智能公司) Yonsei University(延世大学) Lablup Inc.(Lablup公司)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22674 2025-09-30 cs.CV 83%

Pathological Truth Bias in Vision-Language Models

Yash Thube

机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);LLaVA(abstract);分类 cs.CV

Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 83%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02910 2025-09-30 cs.CV cs.AI 81%

ImgTrojan: Jailbreaking Vision-Language Models with ONE Image

Xijia Tao, Shuai Zhong, Lei Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23879 2025-09-30 cs.CV cs.AI cs.CL cs.MM 73%

PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications

Hitesh Laxmichand Patel, Amit Agarwal, Srikant Panda, Hansa Meghwani, Karan Dua, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25177 2025-09-30 cs.CV 70%

Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding

Bingkui Tong, Jiaer Xia, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21262 2025-09-30 cs.CL 67%

Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication

Evgeny Kaskov, Elizaveta Petrova, Petr Surovtsev, Anna Kostikova, Ilya Mistiurin, Alexander Kapitanov, Alexander Nagaev

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00310 2025-09-30 cs.RO cs.AI 57%

TReF-6: Inferring Task-Relevant Frames from a Single Demonstration for One-Shot Skill Generalization

Yuxuan Ding, Shuangge Wang, Tesca Fitzgerald

机构 * Yale University(耶鲁大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23284 2025-09-30 cs.CV 57%

Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval

Dohwan Ko, Ji Soo Lee, Minhyuk Choi, Zihang Meng, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Meta GenAI(Meta 生成人工智能) KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 11 篇

2509.23828 2025-09-30 cs.CV 83%

Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation

Hanyu Zhou, Gim Hee Lee

机构 * School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13067 2025-09-30 cs.CV 79%

HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models

Xu Li, Yuxuan Liang, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24491 2025-09-30 cs.CV cs.AI 79%

Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs

Yuanshuai Li, Yuping Yan, Junfeng Tang, Yunxuan Li, Zeqi Zheng, Yaochu Jin

机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22697 2025-09-30 cs.CV cs.AI cs.LG 75%

Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment

Abhiroop Chatterjee, Susmita Ghosh

机构 * Jadavpur University(贾瓦帕尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV 2025), Workshop on Curated Data for Efficient Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23781 2025-09-30 cs.CV cs.AI 73%

GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning

Nayeong Kim, Seong Joon Oh, Suha Kwak

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学) Tübingen AI Center(图宾根人工智能中心) Universität Tübingen(图宾根大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments This paper was first submitted to NeurIPS 2024 in May 2024

详情

展开后加载摘要…

URL PDF HTML 收藏