arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 20 篇

2507.23064 2025-10-14 cs.CV cs.AI cs.LG cs.RO 67%

Vision-Language Cross-Attention for Real-Time Autonomous Driving

Santosh Patapati, Trisanth Srinivasan, Murari Ambati

机构 * Cyrion Labs(Cyrion实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23042 2025-10-14 cs.CV cs.AI cs.LG cs.MM cs.RO 67%

Goal-Based Vision-Language Driving

Santosh Patapati, Trisanth Srinivasan

机构 * Dept. of HCI(人机交互系) Cyrion Labs(Cyrion实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10962 2025-10-14 cs.LG cs.AI 62%

MC#: Mixture Compressor for Mixture-of-Experts Large Models

Wei Huang, Yue Liao, Yukang Chen, Jianhui Liu, Haoru Tan, Si Liu, Shiming Zhang, Shuicheng Yan, Xiaojuan Qi

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) NVIDIA Research(NVIDIA研究)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09762 2025-10-14 cs.LG cs.AI 62%

PatentVision: A multimodal method for drafting patent applications

Ruo Yang, Sai Krishna Reddy Mudhiganti, Manali Sharma

机构 * Samsung Semiconductor, Inc.(三星半导体公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10633 2025-10-14 cs.AI 57%

Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion

Jiabao Shi, Minfeng Qi, Lefeng Zhang, Di Wang, Yingjie Zhao, Ziying Li, Yalong Xing, Ningran Li

机构 * Minzu University of China(民族大学) City University of Macau(澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) The University of Adelaide(阿德莱德大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10022 2025-10-14 cs.CV 57%

Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning

Junan Chen, Trung Thanh Nguyen, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09822 2025-10-14 cs.CV cs.CL 57%

Task-Aware Resolution Optimization for Visual Large Language Models

Weiqing Luo, Zhen Tan, Yifan Li, Xinyu Zhao, Kwonjoon Lee, Behzad Dariush, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Michigan State University(密歇根州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Accepted as a main conference paper at EMNLP 2025. 9 pages (main content), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12067 2025-10-14 cs.CV 57%

A Comprehensive Survey on Knowledge Distillation

Amir M. Mansourian, Rozhan Ahmadi, Masoud Ghafouri, Amir Mohammad Babaei, Elaheh Badali Golezani, Zeynab Yasamani Ghamchi, Vida Ramezanian, Alireza Taherian, Kimia Dinashi, Amirali Miri, Shohreh Kasaei

机构 * Sharif University of Technology(谢里夫科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Published at TMLR (102 pages, 10 figures, 17 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 5 篇

2508.10315 2025-10-14 cs.LG cs.AI 62%

A Vision-Language Pre-training Model-Guided Approach for Mitigating Backdoor Attacks in Federated Learning

Keke Gai, Dongjue Wang, Jing Yu, Liehuang Zhu, Qi Wu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息空间科学与技术学院,北京理工大学) School of Information Engineering, Minzu University of China(信息工程学院,民族大学) Australian Institute of Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10100 2025-10-14 cs.CV cs.LG 62%

Cooperative Pseudo Labeling for Unsupervised Federated Classification

Kuangpu Guo, Lijun Sheng, Yongcan Yu, Jian Liang, Zilei Wang, Ran He

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.LG

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11498 2025-10-14 cs.LG cs.CL 57%

ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding

Yuhang Li, Chenchen Zhang, Ruilin Lv, Ao Liu, Ken Deng, Yuanxing Zhang, Jiaheng Liu, Wiggin Zhou, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) Peking University(北京大学) Nanjing University(南京大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07501 2025-10-14 cs.CV cs.HC 57%

FormCoach: Lift Smarter, Not Harder

Xiaoye Zuo, Nikos Athanasiou, Ginger Delmas, Yiming Huang, Xingyu Fu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10637 2025-10-14 cs.RO 50%

High-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splatting

Haoyu Zhao, Cheng Zeng, Linghao Zhuang, Yaxi Zhao, Shengke Xue, Hao Wang, Xingyue Zhao, Zhongyu Li, Kehan Li, Siteng Huang, Mingxiu Chen, Xin Li, Deli Zhao, Hua Zou

机构 * Wuhan University(武汉大学) DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 其他VLM :MLLM(abstract)

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏