arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-30 至 2026-01-30 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2506.03229 2026-01-30 cs.CV cs.AI 86%

Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation

弥合弱监督学习与VLM知识蒸馏:面向高效下游适应的噪声部分标签学习

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出协同一致性正则化框架,通过协同伪标签机制和抗过拟合策略,提升预训练VLMs在噪声部分标签下的下游适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22020 2026-01-30 cs.LG cs.CV 84%

Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning

多模态大语言模型去敏中的视觉引导关键标记正则化

Chengyi Cai, Zesheng Ye, Peike Li, Bo Han, Jianzhong Qi, Feng Liu

机构 * The University of Melbourne(墨尔本大学) Google Research(谷歌研究) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出视觉引导的关键标记正则化方法,用于多模态大语言模型的去敏,通过信息熵定义关键标记并利用梯度重新加权提升去敏效果,实验表明能有效减少遗忘并保持响应一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19139 2026-01-30 cs.LG cs.DC cs.ET 79%

Native LLM and MLLM Inference at Scale on Apple Silicon

在Apple Silicon上大规模原生LLM和MLLM推理

Wayner Barrios

机构 * Wiqonn Technologies(Wiqonn技术公司)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.LG

AI总结 vllm-mlx在Apple Silicon上实现高效LLM和MLLM推理,通过原生优化提升文本模型吞吐量并减少多模态延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21740 2026-01-30 cs.MM cs.SD 67%

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

MIDI-LLaMA:一种用于符号音乐理解的指令遵循多模态大语言模型

Meng Yang, Jon McCormack, Maria Teresa Llano, Wanchao Su, Chao Lei

机构 * SensiLab, Monash University, Australia(Monash大学) University of Sussex, Brighton, United Kingdom(Sussex大学) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

AI总结 MIDI-LLaMA通过结合MusicBERT和Llama-3-8B,实现了对符号音乐的指令遵循理解,显著提升了音乐描述和语义对齐能力。

Comments Accepted for publication at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 62%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 62%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 57%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2601.21794 2026-01-30 cs.LG 79%

Knowledge Vector Weakening: Efficient Training-free Unlearning for Large Vision-Language Models

知识向量削弱:高效无训练卸载方法用于大视觉-语言模型

Yejin Kim, Dongjun Hwang, Sungmin Cha, Junsuk Choe

机构 * Sogang University(ソガン大学) New York University(纽约大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

AI总结 KVW提出了一种无需训练的高效卸载方法,通过削弱模型中被激活的知识向量,有效防止模型利用有害知识,提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03803 2026-01-30 cs.CV 79%

Causality-guided Prompt Learning for Vision-language Models via Visual Granulation

基于视觉粒化的因果引导提示学习用于视觉语言模型

Mengyu Gao, Qiulei Dong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CaPL方法,通过视觉粒化和因果推理提升细粒度识别性能,实验表明其在细粒度数据集上表现优异。

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 57%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏