The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NIPS 2018; Figure 1 was updated
CLIP-CC-Bench:评估视频语言模型中的段落级视频描述
机构 * South Dakota State University(南达科他州立大学)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.MM
AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。
Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026
重新路由,而非移除:面向视觉语言模型的可恢复视觉令牌路由
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; National Taiwan University(国立台湾大学)
专题命中 图文多模态 :MLLM(abstract,comments);分类 cs.CV、cs.AI
AI总结 针对视觉语言模型中视觉令牌重要性随解码器深度变化的问题,提出无需训练的可恢复路由方法Reroute,将不可逆移除改为可恢复路由,在激进令牌缩减下提升定位能力并保持通用VQA性能。
Comments Code: https://github.com/elmma/mllm-reroute/
将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) ; Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.AI
AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。
Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM
机构 * Indian Institute of Technology, Roorkee(印度理工学院拉胡尔分校)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.AI
Comments Accepted at ICCV2025 Workshop on Safe and Trustworthy Multimodal AI Systems
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL;cross-modal(comments)
Comments International Workshop on Cross-Modal Learning in Real World, ICCV 2019
Re³Cap:基于强化学习的图像字幕增强的检索引导优化
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。
Comments Accepted to EMNLP 2026 Main Conference
视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。
Comments Accepted at EMNLP 2026 (Findings)
当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用
机构 * VISTEC ; Bangkok Christian International School(巴吞普林国际学校) ; AI Singapore(AI新加坡)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。
当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。
语言模型与视觉-语言模型中的后门学习
机构 * Stony Brook University(石溪大学) ; The Graduate School(研究生院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。
Comments Ph.D. dissertation
零样本隐私分类中视觉语言模型的鲁棒性研究
机构 * Idiap Research Institute(Idiap研究机构) ; Queen Mary University of London(伦敦女王学院) ; EPFL(瑞士联邦理工学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 本研究分析零样本设置下视觉语言模型(VLMs)用于图像隐私分类的可靠性,对比三类开源VLMs与专用模型的性能,发现VLMs鲁棒但精度低、速度慢,凸显专用隐私分类模型的优势。
Comments 15 pages, 6 figures, 3 tables. Paper accepted at the TrustDOC Workshop at ICPR 2026
哪个来源更胜一筹?视觉-语言模型中依赖关系的任务依赖性
机构 * University of South Florida(南佛罗里达大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该研究探究视觉-语言模型的模态依赖,通过构建算术与图表冲突基准,发现其依赖关系随任务、证据结构等变化,不同模型在对应基准中呈现相反的模态依赖模式。
Comments 20 pages. Under review
LoopVLA: 在视觉-语言-动作模型中学习充分性
机构 * Huazhong University of Science and Technology(华中科技大学) ; Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。
DesCLIP:通过通用属性描述实现基于视觉语言模型的鲁棒持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出DesCLIP,通过通用属性描述引导视觉语言模型理解特定类别对象,建立视觉-通用属性-类别三元关联,提升持续学习效果。
Comments IEEE Transactions on Multimedia 2026
Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 5021-5035, 2026
MiniGPT-反向设计:利用MiniGPT-4预测图像调整
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。
Comments 8 pages, 7 figures
TIMA:用于平衡零样本对抗鲁棒性与泛化能力的文本-图像互感知框架
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对CLIP等基础模型在零样本场景下难平衡对抗鲁棒性与泛化能力的问题,提出TIMA框架,通过TAI与IAT两个模块校准Logit间距、保留语义一致性,实验显示其性能优于现有方法。
减少矩阵乘法:面向大语言模型推理的输入自适应矩阵乘积约简方法
机构 * University of Chicago(芝加哥大学) ; Stony Brook University(石溪大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对Transformer语言模型推理开销高的问题,提出无需训练的输入自适应RMM方法,通过选择矩阵乘积信息切片减少计算,在多任务多模型上验证其鲁棒性,可提升长序列推理效率,且适用于多模态场景。
Comments 24 pages
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。
Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap
HybridToken-VLM:用于视觉-语言模型的混合令牌压缩
机构 * Sun Yat-sen University(中山大学) ; Princeton University(普林斯顿大学) ; Snap Inc(Snap公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率
Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM
TemMed-Bench:评估视觉语言模型的时序医学图像推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。
Jako Tako 还是 Fluent?推出 PoVisLE:波兰语视觉-语言评估基准
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对现有英语中心视觉-语言模型在文化理解上的不足,推出波兰语单文化视觉-语言基准 PoVisLE,含1117张图像与2366对标注VQA样本,可评估深层文化多模态理解。
Comments 28 pages. Preprint under review
DataComp-VLM:改进的视觉语言模型开放数据集
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。
Comments Preprint
SLED:通过知识蒸馏实现可扩展位置编码
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。
GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。
链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考
机构 * UC Berkeley(加州大学伯克利分校) ; UCLA(洛杉矶大学) ; Panasonic AI Research(松下人工智能研究)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。
Comments Project page: https://wakalsprojectpage.github.io/covt-website/
注意力对字母大小写敏感
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。