Localized Latent Updates for Fine-Tuning Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Journal ref 2021 International Conference on Natural Language Processing
用于从视频理解复杂装配动作的组合上下文微调视觉语言模型
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; The University of Auckland(奥克兰大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;vision language model(comments)
AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。
Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly
机构 * School of Computer Science, The University of Manchester, Manchester, UK(曼彻斯特大学计算机科学学院)
专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,comments);分类 cs.CV
Comments VLM/LLM Learning Notes
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; BUPT(北京邮电大学) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://zcmax.github.io/projects/LLaVA-3D/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2025; Project Page: https://llava-vl.github.io/blog/2024-10-03-llava-critic
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;VLM(comments)
Comments Project page: https://cece-vlm.github.io/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.AI
Comments CVPR 2024, MMFM workshop. Authors 1 and 2 contributed equally. Models available at https://huggingface.co/intel/llava-gemma-2b/ and https://huggingface.co/intel/llava-gemma-7b/ Training code at https://github.com/IntelLabs/multimodal_cognitive_ai/tree/main/LLaVA-Gemma
用于视频游戏数据标注的视觉语言模型(VLMs)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。
RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; China University of Mining Technology(中国矿业大学)
专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn)
AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。
面向电商图像生成的元素感知组学习
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
MOON2.0:动态模态平衡多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。
Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures
FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract)
AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。
用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏
机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。
Comments 11 pages, 5 figures, 8 tables
用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥
机构 * The University of Sydney(悉尼大学) ; Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) ; Beijing Normal University(北京师范大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。
Comments Accepted at MICCAI 2026
RADIO1D:用于压缩视觉建模的弹性表示
机构 * NVIDIA(英伟达)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。
Comments Published as main conference paper at ICML 2026
HiPath: 用于结构化病理报告预测的分层视觉-语言对齐
机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) ; Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系) ; Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department) ; Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出HiPath框架,通过分层补丁聚合器、对比学习和槽位掩码诊断预测,在冻结UNI2和Qwen3骨干上实现结构化病理报告预测,准确率达68.9%,安全率97.3%。
Comments 10 pages, 1 figures, 3 tables
语义浏览:图像生成的可控多样性
机构 * Tel Aviv University(特拉维夫大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。
Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/
基于AI生成描述的1亿+星系图像语义搜索
机构 * New York University(纽约大学) ; University of Toronto(多伦多大学) ; Dunlap Institute for Astronomy & Astrophysics(达伦普天文与天体物理研究所) ; University of California, Berkeley(加州大学伯克利分校) ; Center for Data Science(数据科学中心) ; Lawrence Berkeley National Lab(伯克利国家实验室) ; Flatiron Institute(Flatiron研究所) ; Université Paris-Saclay(巴黎-萨克莱大学) ; CEA(法国原子能委员会) ; CNRS(法国国家科学研究中心) ; AIM(应用数学研究所) ; Princeton University(普林斯顿大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出利用视觉语言模型生成星系图像描述,并对比对齐预训练天文学基础模型,构建可搜索嵌入,实现大规模星系图像的语义搜索,在稀有现象发现上取得最先进性能。
Comments ApJ, in press
Stage-1 控制熵状态,而非最终结果
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文通过小数据实验研究两阶段后训练中Stage-1(SFT或OPD)的作用,发现其主要影响策略熵状态,但对最终性能影响有限。
VESTA: 基于统计工具代理的视觉探索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出VESTA框架,通过动态增长的工具集指导数据变换、假设驱动可视化和统计检验,提升视觉语言模型在复杂统计建模任务上的性能。
Vision-OPD:通过在线策略自蒸馏学习多模态大语言模型的精细细节
机构 * Tsinghua University(清华大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Vision-OPD框架,通过在线策略自蒸馏将模型自身的局部区域感知能力迁移到全局图像策略,提升多模态大语言模型对细粒度视觉理解的准确性。
Comments Project page: https://github.com/VisionOPD/Vision-OPD
基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式
机构 * Technische Universität Berlin(柏林技术大学) ; Rice University(Rice 大学) ; AWS AI Labs, Amazon(Amazon 人工智能实验室) ; IIT Delhi(德里理工学院) ; University of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Spector Inc(Spector 公司) ; IIIT-Hyderabad(海得拉巴理工学院) ; Microsoft(微软)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。
Comments 57 pages, 39 figures
CATA: 通过冲突厌恶任务算术实现持续机器去学习
机构 * Fujian Normal University(福建师范大学) ; Nanyang Technological University(南洋理工大学) ; Xidian University(西安电子科技大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文首次研究了视觉语言模型的持续去学习问题,提出CATA方法,通过冲突厌恶任务算术有效解决去学习中的有效性、模型保真度和持续性挑战。
你的CLIP有164个噪声维度:探索对比性预训练视觉-语言变换器的嵌入协方差特征谱
机构 * Warsaw University of Technology(华沙技术大学) ; Centre for Credible Artificial Intelligence(可信人工智能中心) ; University of Warsaw(华沙大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文通过协方差矩阵谱分解,揭示对比预训练VLMs的潜在空间中多模态噪声结构,发现去除共享噪声维度对下游任务性能无害,提供对现代VLMs表征结构的新见解。
STARE:分步时间对齐与红队引擎用于多模态毒性攻击
专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn)
AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。
Comments ICML 2026
PhyCo:学习可控制的物理先验以生成运动
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NEC Labs America(NEC美国实验室) ; UC San Diego(圣地亚哥大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。
Comments CVPR 2026. Project Page: https://phyco-video.github.io/
EmbodiedLGR:整合轻量级图表示与检索用于机器人代理中的语义-空间记忆
机构 * Department of Electronics, Information, and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract)
AI总结 本文提出EmbodiedLGR-Agent,通过参数高效VLM构建语义-空间记忆,实现高效的环境记忆表示与检索,实验证明其在推理和查询时间上达到SOTA,且在实际部署中表现出良好的实用性。
Comments 8 pages, 3 figures