SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments Added the dataset link to the abstract
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments Added the dataset link to the abstract
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.AI、cs.LG
Comments 10 pages, 11 figures
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
Comments 18 pages, 8 figures, Published in CVPR2024
Journal ref In Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments EMNLP 2023
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments Accepted to NeurIPS 2023, project webpage: https://fengyuli-dev.github.io/dn-website/
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments Published at ICCV 2023
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG
Comments 9 pages, preprint
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :grounding(title);分类 cs.AI、cs.LG
对齐即全部所需:通用音频-语言模型的无指令训练
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯混元)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。
CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。
Comments Accepted to SIGGRAPH Asia 2026
AI供应链应用中的联合中毒攻击
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本研究提出AI供应链中的联合中毒攻击,通过包装器与元数据的交互改变模型行为,提出TIF-BAH防御,揭示AI部署中存在未被现有防御覆盖的部署时行为风险。
Genie Sim 3.0:人形机器人综合仿真平台
机构 * AgibotTech(Agibot科技)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 Genie Sim 3.0通过高保真场景生成和开放数据集,提升机器人学习模型的泛化能力与仿真到现实的迁移效果。
MBA:面向现实世界商业创意的多模态基准与智能体
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。
Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA
反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract)
AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。
StageCraft: 通过执行意识缓解VLA模型中干扰和障碍故障
机构 * Arizona State University(亚利桑那州立大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 StageCraft通过利用大规模视觉语言模型进行推理,改进预训练VLA策略性能,通过操控环境初始状态避免执行故障,实现在三个真实任务领域中性能提升40%。
Comments Accepted to IEEE International Conference on Intelligent Robots and Systems (IROS) 2026
关键姿态探索:高效的自动轨迹标注与跨实体策略迁移
机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。
Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling
PIXELRAG:网页截图在检索增强生成中优于文本
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。
Comments Our code is available at https://github.com/StarTrail-org/PixelRAG
UniFS:面向视觉-语言-动作模型的统一快慢层次架构
机构 * Tianjin University(天津大学) ; Yiwu Research Institute of Fudan University(复旦大学义乌研究院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。
Comments Code is opensourced at https://github.com/linsun449/UniFS
BIT-Nav: 具身导航的脑启发轨迹记忆
机构 * Johns Hopkins University(约翰霍普金斯大学) ; DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。
Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments
通过动作令牌干预引导自回归视觉-语言-动作策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。
Comments 9 pages, 5 figures
APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力
机构 * Zhejiang University(浙江大学) ; Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。
多模态大语言模型在跨模态间无法最优组合技能
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文研究多模态大语言模型跨模态技能组合能力,发现其存在显著差距,并提出链式推理和微调策略以改善,但效果有限。
显式表示对齐用于多模态情感分析
机构 * AgentAlpha
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。
Comments 10 pages, 5 figures
MACD:基于反事实数据的模型感知对比解码
机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) ; University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。
PAND:面向提示的邻域蒸馏用于轻量级细粒度视觉分类
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PAND框架,通过提示感知语义校准和邻域感知结构蒸馏,将大型视觉语言模型知识迁移至轻量网络,在细粒度分类任务上超越现有方法。
Comments Accepted by ICIP2026
DenseMLLM:用于密集预测的标准多模态大语言模型
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系) ; Tencent, Youtu-Lab, China(腾讯优图实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出DenseMLLM,通过标准多模态大语言模型架构和视觉令牌监督策略,无需任务特定解码器即可实现语义分割、深度估计等密集预测任务,在多个基准上取得竞争性能。
Comments ICML 2026
PARCEL: 基于池锚定的条件弹性查询重采样以实现高效视觉-语言理解
机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所) ; Google(谷歌)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PARCEL视觉分词架构,通过池锚定和条件弹性查询重采样解决视觉令牌压缩中的空间与查询表示冲突,在27个基准上提升性能-效率帕累托前沿。
Comments 33 pages, 4 figures
EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现
机构 * Computational Health Informatics Program(计算健康信息学项目) ; Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。
BioFact-MoE:基于生物学因子分解的混合专家模型用于肝细胞癌的视觉-语言预后建模
机构 * Department of Radiology \& Biomedical Imaging, Department of Biomedical Engineering, Department of Electrical Engineering, Department of Statistics \& Data Science Yale University, New Haven, CT, 06510, USA
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出BioFact-MoE框架,通过生物学监督的混合专家模型显式分解肝脏和肿瘤因子,在肝细胞癌预后预测中提升准确性和生物学可解释性。
Comments Early accepted at MICCAI 2026