Unsupervised Elicitation of Moral Values from Language Models
无监督从语言模型中提取道德价值观
机构 * University of Zurich(苏黎世大学) ; IPM(伊朗高等教育科学院)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
无监督从语言模型中提取道德价值观
机构 * University of Zurich(苏黎世大学) ; IPM(伊朗高等教育科学院)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。
医疗大视觉-语言模型的直接偏好优化基准测试
机构 * Korea University(韩国大学) ; AIGEN Sciences(AIGEN公司) ; Hanyang University College of Medicine(翰林大学医学院) ; Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医院) ; Yale University(耶鲁大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文评估了医疗领域中多种DPO变体,发现其在视觉问答任务中存在性能不一致和视觉误解问题,并提出针对性策略提升3.6%。
Comments EACL 2026 (Findings)
将视觉世界编码:通过视觉语言模型从图像到模拟
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文研究了视觉语言模型通过Im2Sim方法从图像生成模拟的能力,发现其在复杂系统建模上表现优异,但对细节复制能力有限。
具身学习奖励以实现肌肉骨骼控制与视觉语言模型
机构 * Tsinghua University(清华大学) ; California Institute of Technology(加州理工学院)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract)
AI总结 本文提出MoVLR框架,利用视觉语言模型实现高维肌肉骨骼系统的具身学习,通过迭代交互发现和改进奖励函数。
Comments 18 pages, 8 figures
ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。
对视觉-语言模型中残障人表示的审计
机构 * Lam Research
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI
AI总结 本文研究了视觉-语言模型在残障人表示上的表现,通过引入残障情境化提示和评估框架,发现残障情境会降低模型解释忠实度,并提出针对性提示和微调方法来改善模型表现。
grounded concreteness: 人类-like 的 concreteness 敏感性在 vision-language 模型中
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract)
AI总结 本文研究了视觉语言模型在纯文本提示下对concreteness的敏感性,并发现其在更具体的输入上表现更优,具有更清晰的表示和更符合人类规范的判断。
通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘
机构 * UC San Diego(加州大学圣迭戈分校) ; University of New South Wales(新南威尔士大学) ; Adobe Research(Adobe研究)
专题命中 VLM训练与架构 :MLLM(title);分类 cs.CV、cs.LG
AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。
Comments 9 pages
DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估
机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) ; Vantor, Linköping, Sweden(林奈瑞典)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。
Comments Under review at ICPR 2026
MMR-Bench: 多模态大语言模型路由的综合基准
机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。
多智能体辩论中的动态角色分配
机构 * New York University(纽约大学) ; Amazon AGI(亚马逊人工智慧)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 本文提出动态角色分配框架,通过元辩论选择适合的智能体,提升多代理辩论系统的性能。
DeepInsert: 早期层绕过以实现高效且高性能的多模态理解
机构 * UIUC(伊利诺伊大学) ; Amazon(亚马逊) ; Capital One ; Apple(苹果) ; Stony Brook University(石溪大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。
Comments To be presented at EACL 2026 (Main Conference)
CLIP的视觉嵌入投影器是少样本宝库
机构 * Inria(法国国家信息与自动化技术研究所) ; Kyutai
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 ProLIP通过正则化投影矩阵提升CLIP在少样本分类及跨领域迁移中的性能,提供更高效的替代方案。
Comments WACV 2026
StyleDecoupler: 可泛化艺术风格解耦
机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。
熊、所有熊,以及一些熊。语言模型归纳推理中的语言约束
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision language model(abstract)
AI总结 该研究探讨了视觉语言模型在区分不同归纳推理类型时的语言约束,通过实验发现模型与人类在行为上具有一致性,差异源于归纳约束而非表层形式。
Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。
多智能体机器人系统(MARS)挑战的进展与创新
机构 * SJTU(上海交通大学) ; Oxford(牛津大学) ; USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; CMU(卡内基梅隆大学) ; HKU(香港大学) ; Tongji(同济大学) ; UC San Diego(南加州大学) ; CUHK-SZ(香港中文大学(深圳)) ; SYSU(华南理工大学) ; Harvard(哈佛大学)
专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。
Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/
多模态评估框架MERA Multi对俄语架构的评估
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。
Comments EACL main track
RemEdit: 基于黎曼几何的高效扩散编辑
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 RemEdit通过基于黎曼几何的潜在空间导航和任务特定注意力剪枝机制,实现了高效且保真的图像编辑,同时保持实时性能。
Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision, WACV 2026
AVMeme Exam: 一个多模态、多语言、多文化的基准测试,用于评估LLM的上下文和文化知识与思维
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
AI总结 AVMeme Exam 通过多模态、多语言、多文化的基准测试,评估LLM在上下文和文化理解方面的局限性,揭示模型在无文本音乐和文化思维上的不足。
Comments avmemeexam.github.io/public
多尺度时间预测 via 逐步生成和多智能体协作
机构 * National University of Singapore(新加坡国立大学) ; Alibaba Group(阿里巴巴集团) ; Renmin University of China(中国人民大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出了一种多尺度时间预测方法,通过逐步生成和多智能体协作,提升多尺度和多状态预测的准确性和一致性。
Comments 20 pages, 6 figures
Journal ref NeurIPS 2025