arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2601.22696 2026-02-02 cs.CV cs.LG 62%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22189 2026-02-02 eess.IV cs.CV cs.LG cs.MM 62%

SCENE: Semantic-aware Codec Enhancement with Neural Embeddings

SCENE:基于神经嵌入的语义感知编码器增强

Han-Yu Lin, Li-Wei Chen, Hung-Shin Lee

机构 * United Link Co., Ltd.(联合链接有限公司) Dept. Computer Science and Information Engineering, National Tsing Hua University(国立清华大学计算机科学与信息工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SCENE通过整合视觉语言模型的语义嵌入,实现对压缩视频中伪影的语义感知增强,提升感知质量和细节纹理保留。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 62%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 62%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 62%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15370 2026-01-23 cs.LG cs.AI 62%

Improving MoE Compute Efficiency by Composing Weight and Data Sparsity

通过组合权重和数据稀疏性提高MoE计算效率

Maciej Kilian, Oleg Mkrtchyan, Luke Zettlemoyer, Akshat Shrivastava, Armen Aghajanyan

机构 * University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 通过结合权重和数据稀疏性,提高MoE计算效率,减少训练-推理不匹配,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 62%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20941 2026-01-21 cs.LG cs.AI physics.flu-dyn 62%

A Multi-fidelity Double-Delta Wing Dataset and Empirical Scaling Laws for GNN-based Aerodynamic Field Surrogate

多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律

Yiren Shen, Juan J. Alonso

机构 * Department of Aeronautics and Astronautics(航空与宇航系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律,通过实验发现数据量与预测精度呈幂律关系,提出最优采样密度为每个维度八个样本。

Journal ref AIAA SCITECH 2026 Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10378 2026-01-21 cs.CV cs.AI 62%

Global Context Compression with Interleaved Vision-Text Transformation

全局上下文压缩与交错视觉-文本转换

Dian Jiao, Jiaxin Duan, Shuai Zhao, Jiabing Leng, Yiran Zhang, Feng Huang

机构 * China Electronics Cloud Technology Co Ltd.(中国电子云科技有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIST2模型,通过交错视觉与文本信息实现全局上下文压缩,提升长写任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11269 2026-01-19 cs.CV cs.AI 62%

X-Distill: Cross-Architecture Vision Distillation for Visuomotor Learning

X-Distill:跨架构视觉蒸馏用于视觉-运动学习

Maanping Shao, Feihong Zhang, Gu Zhang, Baiye Cheng, Zhengrong Xue, Huazhe Xu

机构 * Tsinghua University(清华大学) Institute for Interdisciplinary Information Sciences(交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 X-Distill通过跨架构知识蒸馏结合视觉转换器和紧凑型CNN,实现了在数据有限的机器人操作任务中优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08017 2026-01-14 cs.CV cs.AI 62%

Representations of Text and Images Align From Layer One

文本和图像的表示从第一层对齐

Evžen Wybitul, Javier Rando, Florian Tramèr, Stanislav Fort

机构 * D-INFK, ETH Zurich, Switzerland(苏黎世联邦理工学院信息与知识系统研究所) Aisle Research(Aisle研究)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究通过合成方法证明,视觉-语言模型中图像和文本表示在第一层即可实现对齐,为模型可解释性提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17875 2026-01-14 cs.CV cs.LG 62%

Visually Prompted Benchmarks Are Surprisingly Fragile

通过视觉提示的基准测试出人意料地脆弱

Haiwen Feng, Long Lian, Lisa Dunlap, Jiahao Shu, XuDong Wang, Renhao Wang, Trevor Darrell, Alane Suhr, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究发现视觉提示基准测试对细节敏感,通过创建VPBench减少不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 62%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04404 2026-01-09 cs.CV cs.AI 62%

3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation

3D-Agent:三模态多智能体协作用于可扩展的3D物体标注

Jusheng Zhang, Yijia Fan, Zimo Wen, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 Tri MARF通过三模态多智能体协作提升大规模3D物体标注效率与精度

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14435 2026-01-08 cs.CV cs.LG 62%

MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models

MoTE:混合三元专家用于内存高效的大型多模态模型

Hongyu Wang, Jiayu Xu, Ruiping Wang, Yan Feng, Yitao Zhai, Peng Pei, Xunliang Cai, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 MoTE通过训练更多低精度三元专家,实现内存高效的大规模多模态模型训练,提升端任务性能并降低内存需求。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17254 2026-01-07 cs.CV cs.AI 62%

Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats

干预所有路径:统一缓解跨对齐格式的大型视觉-语言模型幻觉

Jiaye Qian, Ge Zheng, Yuchen Zhu, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种统一干预框架,通过分析不同路径间的相互作用,有效缓解跨对齐格式的LVLM幻觉问题。

Comments Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01024 2026-01-06 cs.CV cs.AI cs.IR 62%

ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval

ITSELF: 基于注意力引导的细粒度对齐用于视觉-语言检索

Tien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 ITSELF通过基于注意力引导的细粒度对齐框架,在视觉-语言检索任务中实现最先进的性能和跨数据集泛化能力。

Comments Accepted at WACV Main Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00993 2026-01-06 cs.CV cs.AI 62%

WildIng: A Wildlife Image Invariant Representation Model for Geographical Domain Shift

WildIng: 一种用于地理域转移的野生动物图像不变表示模型

Julian D. Santamaria, Claudia Isaza, Jhony H. Giraldo

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 WildIng通过整合文本描述与图像特征,提升野生动物在不同地理区域的识别准确率,有效解决地理域转移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24478 2026-01-06 cs.LG cs.AI stat.ME 62%

HOLOGRAPH: Active Causal Discovery via Sheaf-Theoretic Alignment of Large Language Model Priors

HOLOGRAPH:通过sheaf理论对大型语言模型先验进行对齐以实现主动因果发现

Hyunjun Kim

机构 * Korea Advanced Institute of Science \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HOLOGRAPH通过sheaf理论对齐大型语言模型先验,实现主动因果发现,提供严谨的数学基础并实现竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17681 2026-01-06 cs.CV cs.AI 62%

PICABench: How Far Are We from Physically Realistic Image Editing?

PICABench: 我们距离物理真实图像编辑还有多远?

Yuandong Pu, Le Zhuo, Songhao Han, Jinbo Xing, Kaiwen Zhu, Shuo Cao, Bin Fu, Si Liu, Hongsheng Li, Yu Qiao, Wenlong Zhang, Xi Chen, Yihao Liu

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24826 2026-01-01 cs.CV cs.AI 62%

Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free Control

用于多物体3D场景的2D系统中视频与语言对齐的多信息无导数控制

Jason Armitage, Rico Sennnrich

机构 * University of Zurich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无导数优化方法,用于在多物体3D场景中实现视频与语言的对齐,通过在线适应物体遮挡和区分特征来提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07307 2026-01-01 cs.CV cs.AI 62%

MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark

MCITlib: 多模态持续指令微调库与基准

Haiyang Guo, Fei Zhu, Hongbo Zhao, Fanhu Zeng, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新科学研究院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology(福建 pattern recognition and image understanding 工程学院,厦门大学科技学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MCITlib提供多模态持续学习的库和基准,支持8种算法并评估3个基准,旨在解决灾难性遗忘和跨模态协调问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03183 2026-01-01 cs.CV cs.LG 62%

MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding

MaxInfo: 一种基于最大体积的无训练关键帧选择方法以提升视频理解

Pengyi Li, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan Oseledets

机构 * AXXX, Russia(AXXX, 俄罗斯) FusionBrain Lab, Russia(融合脑实验室, 俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所, 俄罗斯) Innopolis University, Russia(因诺波利斯大学, 俄罗斯)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 MaxInfo是一种基于最大体积原理的无训练关键帧选择方法,通过提升视频理解性能,有效减少冗余并保持多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21985 2025-12-29 cs.CV cs.AI 62%

LVLM-Aided Alignment of Task-Specific Vision Models

通过大视觉语言模型辅助对齐任务特定视觉模型

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 通过大视觉语言模型辅助对齐任务特定视觉模型,提升模型与人类规范的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20409 2025-12-24 cs.CV cs.AI 62%

DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning

DETACH:解构时空对齐用于外向视频和环境传感器的分阶段学习

Junho Yoon, Jaemo Jung, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 DETACH通过解构时空对齐方法,解决外向视频与环境传感器在动作识别中的对齐问题,提升模型在Opportunity++和HWU-USP数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19399 2025-12-24 cs.LG cs.AI cs.CL 62%

Brain-Grounded Axes for Reading and Steering LLM States

基于大脑活动的阅读与操控LLM状态的轴

Sandro Andric

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用人类大脑活动作为坐标系,通过ICA提取潜在轴,操控LLM状态,实现可解释和可控的LLM行为。

Comments 10 pages, 4 figures. Code: https://github.com/sandroandric/Brain-Grounded-Axes-for-Reading-and-Steering-LLM-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19663 2025-12-23 cs.CV cs.AI 62%

Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis

超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐

Argha Kamal Samanta, Harshika Goyal, Vasudha Joshi, Tushar Mungle, Pabitra Mitra

机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10067 2025-12-23 cs.CV cs.LG 62%

Independent Density Estimation

独立密度估计

Jiahao Liu, Senhao Cao

机构 * Orcava Inc.(Orcava公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出独立密度估计(IDE)方法,通过学习句子中单个词与图像特征之间的联系,提升模型在组合泛化任务上的性能。

Comments 10 pages, 1 table, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16164 2025-12-19 cs.CV cs.AI 62%

C-DGPA: Class-Centric Dual-Alignment Generative Prompt Adaptation

面向类别的双对齐生成提示适应:C-DGPA

Chao Li, Dasha Hu, Chengyang Li, Yuming Jiang, Yuncheng Shen

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 C-DGPA通过双分支架构协同优化边缘分布和条件分布对齐,提升无监督领域适应中提示学习的领域不变性和语义判别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15464 2025-12-17 cs.CV cs.LG 62%

SIGMMA: Hierarchical Graph-Based Multi-Scale Multi-modal Contrastive Alignment of Histopathology Image and Spatial Transcriptome

SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组

Dabin Jeong, Amirhossein Vahidi, Ciro Ramírez-Suástegui, Marie Moullet, Kevin Ly, Mohammad Vali Sanian, Sebastian Birk, Yinshui Chang, Adam Boxall, Daniyal Jafree, Lloyd Steele, Vijaya Baskar MS, Muzlifah Haniffa, Mohammad Lotfollahi

机构 * Wellcome Sanger Institute(沃森桑格研究所) Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) Institute of AI for Health(人工智能与健康研究所) Cambridge Stem Cell Institute(剑桥干细胞研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏