arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2604.11751 2026-04-14 cs.RO cs.AI 57%

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11337 2026-04-14 cs.MA cs.AI cs.CY 57%

Governance by Design: A Parsonian Institutional Architecture for Internet-Wide Agent Societies

设计治理:一种帕森斯制度架构用于互联网范围的智能体社会

Anbang Ruan

机构 * NetX Foundation(NetX 基金会)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于帕森斯AGIL框架的制度架构,用于治理互联网范围的智能体社会,发现现有生态系统缺乏协调层和规范基础,提出治理基础设施的优先路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12748 2026-04-14 cs.AI cs.HC cs.SE 57%

X-SYS: A Reference Architecture for Interactive Explanation Systems

X-SYS:交互解释系统的参考架构

Tobias Labarta, Nhi Hoang, Maximilian Dreyer, Jim Berend, Oleg Hein, Jackie Ma, Wojciech Samek, Sebastian Lapuschkin

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究所) Technical University Dublin(都柏林理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出X-SYS参考架构,通过STAR质量属性和五组件分解,指导交互解释系统的设计与实现,解决可解释AI在系统部署中的挑战。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07765 2026-04-14 cs.CV 57%

RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs

RemoteAgent: 通过基于强化学习的代理多模态大语言模型弥合模糊人类意图与遥感观测之间的鸿沟

Liang Yao, Shengxiang Xu, Fan Liu, Chuanyi Zhang, Bishun Yao, Rui Min, Yongjun Li, Chaoqian Ouyang, Shimin Di, Min-Ling Zhang

机构 * Hohai University(河海大学) Southeast University(东南大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文提出RemoteAgent框架,通过VagueEO数据集和强化学习微调,使多模态大语言模型能直接解决图像和稀疏区域任务,并通过模型上下文协议智能协调专用工具进行密集预测,提升遥感任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 57%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05564 2026-04-14 cs.CV 57%

ProPhy: Progressive Physical Alignment for Dynamic World Simulation

ProPhy:渐进式物理对齐用于动态世界模拟

Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14543 2026-04-14 cs.CV 57%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 57%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08513 2026-04-10 cs.CV 57%

When Fine-Tuning Changes the Evidence: Architecture-Dependent Semantic Drift in Chest X-Ray Explanations

当微调改变证据:在胸部X光解释中的架构依赖性语义漂移

Kabilan Elangovan, Daniel Ting

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV

AI总结 研究探讨了在多类设置中,微调导致的视觉证据变化,通过评估不同架构在两阶段训练中的表现,揭示了架构依赖性的证据结构重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 57%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV 57%

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 57%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05180 2026-04-08 cs.CV 57%

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

MIRAGE:多实例图像编辑的基准测试与对齐

Ziqian Liu, Stephan Alaniz

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院电信巴黎分校LTCI实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MIRAGE框架,通过多分支并行去噪策略实现精确多实例编辑,解决现有方法在多实例和复合指令下的过度编辑和空间错位问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04857 2026-04-07 cs.CV 57%

The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

适应的盲区:量化和缓解在微调驾驶模型中的遗忘

Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文首次系统研究驾驶模型中灾难性遗忘问题,提出Drive Expert Adapter框架,通过提示空间适应提升驾驶性能并保留通用能力。

Comments received by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04183 2026-04-07 cs.CV 57%

Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification

面向极端远距离视频人的规模感知视觉语言适应

Ashwat Rajbhandari, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于CLIP的视觉语言模型,通过升级视觉主干和引入选择性微调机制,提升远距离视频人重识别的鲁棒性,实验表明在DetReIDX基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03172 2026-04-06 cs.CV 57%

EffiMiniVLM: A Compact Dual-Encoder Regression Framework

EffiMiniVLM:一种紧凑的双编码回归框架

Yin-Loon Khor, Yi-Jie Wong, Yan Chai Hum

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EffiMiniVLM,一种紧凑的双编码回归框架,通过高效网络和轻量级回归头,在冷启动场景中实现高质量产品预测,具有低资源消耗和高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 57%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02973 2026-04-06 cs.CV 57%

Exploring Motion-Language Alignment for Text-driven Motion Generation

探索文本与运动对齐以实现文本驱动的运动生成

Ruxi Gu, Zilei Wang, Wei Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出MLA-Gen框架,通过整合全局运动先验与局部条件,提升文本驱动运动生成的对齐精度,并引入SinkRatio指标解决注意力集中问题,提升运动质量和语义对齐。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 57%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02317 2026-04-03 cs.CV 57%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 57%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 57%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 57%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 57%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 57%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏