Zelda: Video Analytics using Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract)
专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Findings of EMNLP 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2022. Update: Adds results on the DOSCO (DOmain Shift in COntext) benchmark
相似性并非逻辑:双编码器视觉语言模型的因式推理
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG;VLM(comments)
AI总结 研究双编码器视觉语言模型组合约束失效问题,提出因式推理,将证据提取与约束执行分离,引入LCSE方法,在FACTOR-Bench上实验,提升了准确率并保持检索性能。
Comments Accepted at ICML 2026. 18 pages, 8 figures. Project page: https://sultanmo.github.io/factored-vlm Code and benchmark: https://github.com/SultanMo/factored-vlm
机构 * Southeast University(东南大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by ACM MM 2025. First PTQ solution for Multimodal large language models applicable to 5 mainstream MLLMs
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2025. Code: https://github.com/ictnlp/LLaVA-Mini Model: https://huggingface.co/ICTNLP/llava-mini-llama-3.1-8b
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments Project Homepage: https://llava-vl.github.io/blog/2024-08-05-llava-onevision/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.LG
Comments Project Page: https://llava-vl.github.io/blog/2024-06-16-llava-next-interleave/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments 31 pages, 22 figures, 30M PDF file size; Project Page: https://llava-vl.github.io/llava-interactive/
Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.LG
AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。
ReRef-3D:空间指代表达引导的3D场景重排基准
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。
Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)
DashArena:面向交互式分析仪表板生成的大语言模型基准测试
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。
VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩
专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。
Comments Accepted by ACM Multimedia 2026
用于高效长视频理解的证据驱动型动态视觉选择器
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。
Comments Project Page: https://zhangbo135.github.io/EviSelect/
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV
AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。
Comments 4 figures, accepted to ACM MM 26'
超越帧选择:用于长视频理解的生成式潜在证据聚合
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Baidu Inc.(百度公司) ; Alibaba Group(阿里巴巴集团) ; Xidian University(西安电子科技大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。
FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索
机构 * Shandong University(山东大学) ; City University of Hong Kong(香港城市大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shandong Jianzhu University(山东建筑大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。
Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)
MPIE-Bench:解剖学上合理的多人交互编辑基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Metastone Technology(元石科技)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。
ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。
面向盲图像质量评估的统计与视觉-语言特征的失真感知融合
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出一种失真感知融合框架,通过乘法门控机制动态加权NSS统计特征与VLM嵌入,在三个基准上取得最优或竞争性能,并揭示NSS对不同失真的贡献差异。
MultiRef-Compass:迈向多参考到音频-视频生成的综合评估
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。
Comments 32 pages
ELF:无编码器心电图语言模型家族
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Allegheny Health Network(阿勒格尼医疗网络) ; University of California Los Angeles(加州大学洛杉矶分校) ; University of Colorado(科罗拉多大学) ; Allergy and Immunology(过敏与免疫学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。
Comments 34 pages, 12 figures; Accepted to MLHC 2026
工业机器人操作中视觉语言动作模型的LoRA微调效率研究
机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学) ; Siemens AG(西门子股份公司) ; Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.LG
AI总结 研究工业机器人操作中VLA模型的LoRA微调效率,通过在四个精密装配任务上评估,发现特定LoRA配置不比FFT差,r = 32时性能饱和,均匀分配即可,冻结VLM等会降性能,该方法可减少VRAM且无性能损失。
Comments 12 pages, 5 figures, 3 tables. Accepted at the International Conference on Artificial Neural Networks (ICANN 2026); to appear in Springer LNCS
AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; ByteDance Inc.(字节跳动公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。
Comments Accepted by ECCV 2026
超人:统一骨骼与视觉用于人体运动感知与生成
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) ; Sony R&D Center(索尼研发中心) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。
面向资源受限消费级GPU的视觉模型与VLM的高效PEFT方法及自适应检查点技术
机构 * Department of Computer Science, Nazarbayev University(计算机科学系,纳扎尔拜耶夫大学)
专题命中 VLM训练与架构 :VLM(title_cn,abstract_cn);vision language model(abstract);分类 cs.CV
AI总结 本文在2GB VRAM限制下,比较了五种PEFT方法在Transformer和Mamba视觉骨干上的表现,并提出了自适应梯度检查点算法,在CIFAR-100和DTD上评估了准确率、训练时间、能耗及多目标指标。
从一对一到多对多:面向深度视觉-语言融合的动态跨层注入
机构 * Tongji University(同济大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。