LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV
Comments Accepted by EMNLP 2023's demo track; Code, Pretrained Model, and Dataset: https://github.com/DAMO-NLP-SG/Video-LLaMA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments NA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments Accepted by AAAI-2023. Camera Ready Version
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments CVPR 2023
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments preprints
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
Comments 9 pages, ACL Findings 2021
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法
机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。
聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习
机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。
受损多模态语言模型再现失语症患者的图片命名模式
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。
Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included
用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法
机构 * Hanoi University of Science and Technology(河内科技大学) ; University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) ; Vietnam National University, Ho Chi Minh City(胡志明市国家大学) ; VinUniversity ; Vietnamese-German University(越南德国大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。
Comments Accepted at the ECCV 2026 Workshop
并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩
机构 * The University of Sydney(悉尼大学) ; Tongji University(同济大学) ; University of Surrey(萨里大学) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; City University of Hong Kong(香港城市大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。
NormGuard: 流匹配强化学习中保持奖励的范数约束
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。
Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4
注意力对字母大小写敏感
专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架
机构 * Li Auto Inc.(理想汽车) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。
阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型
机构 * Sony AI(索尼人工智能公司)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。
EgoPlay:用于第一人称视角视频流的事件触发式视频编辑
机构 * Snap Inc.(Snap公司) ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。
Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
ViMax: 智能体视频生成
机构 * The University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。
Comments 20 pages, 13 figures
LFM:利用基础模型进行无源通用域适应
机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) ; Engineering Research Center of Learning-Based Intelligent System, Ministry of Education of the People’s Republic of China, Tianjin University of Technology(中华人民共和国教育部基于学习的智能系统工程研究中心,天津理工大学) ; School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) ; Engineering Research Center of City Intelligence and Digital Governance, Ministry of Education of the People’s Republic of China, Tianjin University(中华人民共和国教育部城市智能与数字治理工程研究中心,天津大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 研究在无源数据时将预训练源模型适应到目标域的问题,提出LFM框架,利用视觉语言模型计算相似度确定标签转移类型、识别未知样本,通过共识策略精炼伪标签训练目标模型,实验验证了该框架的有效性和优越性。
Comments Accepted by IEEE Transactions on Multimedia (2026)
用于现实测试时转导的具有动态收缩的冯·米塞斯-费舍尔混合模型
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 研究针对测试时视觉语言模型性能问题,从惩罚似然估计角度提出具有动态收缩的冯·米塞斯-费舍尔混合模型(MOON),该模型基于分布混合建模,能动态调整收缩强度处理不平衡,无需训练和特定超参,实验验证其性能和效率优势。
Comments Accepted by ICML 2026
Journal ref ICML 2026
PivotMerge: 通过后对齐模型融合弥合异构多模态预训练
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) ; Pengcheng Laboratory(鹏城实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Data Science and Artificial Intelligence Research Institute, China United Network Communications Group Co., Ltd.(中国联合网络通信集团有限公司数据科学与人工智能研究院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PivotMerge框架,通过后对齐模型融合技术,解决多模态预训练中跨模态对齐能力整合问题,提升模型统一语义空间的构建效果。
将大语言模型与图卷积网络集成用于半监督图像分类
机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) ; University of São Paulo (USP)(圣保罗大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。
GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。
Comments Accepted to ACL 2026
通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程
机构 * Sapienza University of Rome(罗马第一大学) ; Sony AI(索尼人工智能)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。