SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
SG-WAM:几何感知策略空间中的自引导世界建模
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
SG-WAM:几何感知策略空间中的自引导世界建模
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。
FineMoLA:基于片段级监督的细粒度动作-语言对齐研究
机构 * Purdue University(普渡大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 针对现有动作-语言数据集仅提供片段级监督导致细粒度对齐不足的问题,提出弱监督框架FineMoLA,将动作-语言对齐建模为最优传输问题,在SnapMoGen上的实验显示其动作-文本定位性能优于基线。
WaveZip:用于视频令牌压缩的小波驱动时空解耦
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。
Comments 13 pages, 10 figures
跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。
Comments 14 pages, preprint
用于3D理解的参数高效CLIP适配:通过统一分词实现
机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) ; University of Trento(特伦托大学) ; University of Pisa(比萨大学) ; Beijing Forestry University(北京林业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Hong Kong University of Science and Technology (GZ)(香港科技大学) ; Shandong University(山东大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。
Comments 14 pages, tokenizer
面向距离的软提示学习用于多模态愉悦-唤醒估计
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Department of Automobile and IT Convergence(汽车与IT融合系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。
Comments 8pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301
VisualRouter:面向长视频理解的查询驱动视觉采样
机构 * Tongji University(同济大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。
统一多语言多模态的LVLM安全对齐:一个通用锚点
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。
CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索
机构 * Technion – Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。
密集监督,稀疏更新:论策略蒸馏的稀疏性与几何结构
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Amap, Alibaba Group(阿里巴巴集团高德地图)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 本文分析策略蒸馏(OPD)中参数更新的稀疏性和几何特性,发现更新稀疏且集中于小权重坐标,并验证了稀疏子网络的有效性。
Comments Code is available at https://github.com/SydCS/OPD-Param-Analysis
SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV
AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。
Comments 14 pages, 3 figures, accepted by PRCV2026
图像跨域检索:一种多模态方法
机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Caption-Matching方法,利用预训练视觉语言模型生成的图像描述作为中间表示,实现跨域图像检索,无需标注数据或进一步训练,在Office-Home和DomainNet上取得显著提升。
MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。
Comments 10 pages
PathSelect:用于全切片病理学的序列令牌选择
机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 针对全切片图像给视觉语言模型带来的计算瓶颈,提出解耦路由框架PathSelect,将令牌剪枝重构成序列选择过程,训练时引入方差保持噪声门等,推理时模块分离,有效减少令牌数,提高准确率并优于基于采样的方法。
ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习
机构 * North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。
Comments 10 pages, 5 figures
用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模
机构 * LG Electronics(LG电子) ; Pusan National University(釜山国立大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。
Comments Accepted to ECCV 2026
DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致
机构 * Dobic Health(多比克健康公司) ; University of Ibadan(伊巴丹大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。
CommandLM:用于自动驾驶车辆的数据驱动行为级描述符
机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。
从零开始扩展原生多模态预训练
机构 * The Chinese University of Hong Kong(香港中文大学) ; LLM Department, Tencent(腾讯大语言模型部)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。
面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) ; School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV
AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。
Comments Accepted by ACM MM 2026
超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互
机构 * Nirma University(尼玛大学) ; Singapore Institute of Technology(新加坡理工学院) ; Marwadi University(马尔瓦迪大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。
SiGMA:用于多模态持续指令微调的符号引导合并与适配
机构 * Seoul National University(首尔国立大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。
Comments Accepted at ECCV 2026
PRiSM:少样本视觉语言模型的原型正则化
机构 * ÉTS Montreal(蒙特利尔高等商学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。
学习检测跨模态否定:潜在表示分析与基于注意力的解决方案
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。
Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861
Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622
一种交互增强的自动驾驶数据集
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。
Comments Accepted for publication in Scientific Data
用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法
机构 * Wuhan University of Technology(武汉理工大学) ; Technical University of Munich(慕尼黑工业大学) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。
Comments Project Page: https://github.com/MedAI-T/MergeMedBench
数字万神殿:使用大语言模型智能体模拟和审计联盟形成
机构 * Ghent University(根特大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。
Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference
Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型
机构 * Adobe(Adobe公司) ; UCLA(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。
Comments 31 pages, 15 figures
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Macau(澳门大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。
Comments 27 pages, 11 figures
自我提升往往是突然的:大规模模型的顿悟式微调
机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院) ; School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 研究大规模模型自主提升,提出顿悟式无训练后微调范式,通过修改关键模块捷径且不更新权重,针对大语言和视觉语言模型有不同实例化,实验证明有效解锁预训练网络潜力,提升性能。