arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2411.14982 2025-09-19 cs.CV cs.CL 57%

Large Multi-modal Models Can Interpret Features in Large Multi-modal Models

Kaichen Zhang, Yifei Shen, Bo Li, Ziwei Liu

机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) LMMs-Lab Team(多模态模型实验室团队) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14060 2025-09-18 cs.CV 57%

VSE-MOT: Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Enhancement

Jun Du, Weiwei Xing, Ming Li, Fei Richard Yu

机构 * School of Software Engineering(软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy(人工智能与数字经济广东实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13760 2025-09-18 cs.CV 57%

Iterative Prompt Refinement for Safer Text-to-Image Generation

Jinwoo Jeon, JunHyeok Oh, Hayeong Lee, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21233 2025-09-18 cs.CV 57%

CROP: Contextual Region-Oriented Visual Token Pruning

Jiawei Guo, Feifei Zhai, Pu Jian, Qianrun Wei, Yu Zhou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Fanyu AI Laboratory, Zhongke Fanyu Technology Co., Ltd, Beijing, China(凡语AI实验室,中科创始人技术有限公司,北京,中国)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08858 2025-09-15 cs.CY cs.LG 57%

Decentralising LLM Alignment: A Case for Context, Pluralism, and Participation

Oriane Peter, Kate Devlin

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

Comments Accepted at AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10899 2025-09-15 cs.LG 57%

A Dataset for Distilling Knowledge Priors from Literature for Therapeutic Design

Haydn Thomas Jones, Natalie Maus, Josh Magnus Ludan, Maggie Ziyu Huan, Jiaming Liang, Marcelo Der Torossian Torres, Jiatao Liang, Zachary Ives, Yoseph Barash, Cesar de la Fuente-Nunez, Jacob R. Gardner, Mark Yatskar

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08940 2025-09-12 cs.CV 57%

Discovering Divergent Representations between Text-to-Image Models

Lisa Dunlap, Joseph E. Gonzalez, Trevor Darrell, Fabian Caba Heilbron, Josef Sivic, Bryan Russell

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02438 2025-09-11 cs.CL cs.AI 57%

Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation

Chuanqi Cheng, Jian Guan, Wei Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03221 2025-09-09 cs.CV eess.IV 57%

ADIR: Adaptive Diffusion for Image Reconstruction

Shady Abu-Hussein, Tom Tirer, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project page https://shadyabh.github.io/ADIR/

Journal ref BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11813 2025-09-08 cs.CV 57%

SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs

Yuanyang Yin, Yaqi Zhao, Yajie Zhang, Yuanxing Zhang, Ke Lin, Jiahao Wang, Xin Tao, Pengfei Wan, Wentao Zhang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02512 2025-09-03 cs.LG 57%

MoPEQ: Mixture of Mixed Precision Quantized Experts

Krishna Teja Chitty-Venkata, Jie Ye, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

Comments Accepted by ICCV Bivision Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02359 2025-09-03 cs.CV 57%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01644 2025-09-03 cs.CV 57%

OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie

机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) Apple(苹果公司) University of California Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01514 2025-09-03 cs.CL cs.AI 57%

MeVe: A Modular System for Memory Verification and Effective Context Control in Language Models

Andreas Ottem

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 16 pages, 7 figures, held online presentation at NLPA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09146 2025-09-03 cs.CV cs.MM 57%

Generative Frame Sampler for Long Video Understanding

Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, Junnan Li

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Peking University(北京大学) Salesforce Research(Salesforce 研究) Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ACL 2025 Findings. Code: https://github.com/yaolinli/GenS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00419 2025-09-03 cs.CV 57%

LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

Lianyu Hu, Fanhua Shang, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21044 2025-08-29 cs.CV 57%

MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs

Junpeng Ma, Qizhe Zhang, Ming Lu, Zhibin Wang, Qiang Zhou, Jun Song, Shanghang Zhang

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18674 2025-08-29 cs.CV 57%

Image-guided topic modeling for interpretable privacy classification

Alina Elena Baia, Andrea Cavallaro

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments Paper accepted at the eXCV Workshop at ECCV 2024. Supplementary material included. Code available at https://github.com/idiap/itm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19527 2025-08-28 cs.CV 57%

MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment

Zhiting Gao, Dan Song, Diqiong Jiang, Chao Xue, An-An Liu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18634 2025-08-28 cs.CV 57%

OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward

Chunlin Zhong, Qiuxia Hou, Zhangjun Zhou, Shuang Hao, Haonan Lu, Yanhao Zhang, He Tang, Xiang Bai

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments 9 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19209 2025-08-27 cs.CV 57%

OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation

Jianwen Jiang, Weihong Zeng, Zerong Zheng, Jiaqi Yang, Chao Liang, Wang Liao, Han Liang, Yuan Zhang, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Homepage: https://omnihuman-lab.github.io/v1_5/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15761 2025-08-27 cs.CV 57%

Waver: Wave Your Way to Lifelike Video Generation

Yifu Zhang, Hao Yang, Yuqi Zhang, Yifei Hu, Fengda Zhu, Chuang Lin, Xiaofeng Mei, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * Bytedance Waver Team(字节跳动Waver团队)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16932 2025-08-26 cs.CV 57%

Align 3D Representation and Text Embedding for 3D Content Personalization

Qi Song, Ziyuan Luo, Ka Chun Cheung, Simon See, Renjie Wan

机构 * Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学) NVIDIA AI Technology Center(NVIDIA AI 技术中心) NVIDIA

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03789 2025-08-25 cs.CV 57%

HPSv3: Towards Wide-Spectrum Human Preference Score

Yuhang Ma, Yunhao Shui, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

机构 * Mizzen AI CUHK MMLab(香港大学MMLab) King’s College London(伦敦国王学院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CPII, InnoHK(创新香港科技促进会)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15036 2025-08-22 cs.CR cs.AI 57%

MoEcho: Exploiting Side-Channel Attacks to Compromise User Privacy in Mixture-of-Experts LLMs

Ruyi Ding, Tianhong Xu, Xinyi Shen, Aidong Adam Ding, Yunsi Fei

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Yale University(耶鲁大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI

Comments This paper will appear in CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03608 2025-08-21 cs.AI cs.DC cs.ET cs.NI 57%

Benchmarking Vector, Graph and Hybrid Retrieval Augmented Generation (RAG) Pipelines for Open Radio Access Networks (ORAN)

Sarat Ahmad, Zeinab Nezami, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14280 2025-08-21 cs.CV 57%

Multi-Rationale Explainable Object Recognition via Contrastive Conditional Inference

Ali Rasekh, Sepehr Kazemi Ranjbar, Simon Gottschalk

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) L3S Research Center(L3S研究中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12399 2025-08-19 cs.CV 57%

Federated Cross-Modal Style-Aware Prompt Generation

Suraj Prasad, Navyansh Mahla, Sunny Gupta, Amit Sethi

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07330 2025-08-19 cs.CV 57%

Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos

Tuyen Tran, Thao Minh Le, Quang-Hung Le, Truyen Tran

机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments Accepted for publication at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07985 2025-08-15 cs.CV 57%

Common Data Properties Limit Object-Attribute Binding in CLIP

Bijay Gurung, David T. Hoffmann, Thomas Brox

机构 * University of Freiburg(弗赖堡大学) deepset

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments accepted at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏