Proof of Commitment: A Human-Centric Resource for Permissionless Consensus
证明承诺:一种以人为中心的资源用于无许可共识
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 证明承诺(PoCmt)通过实时人类参与的非并行化资源,提供了一种无许可共识机制,确保线性Sybil成本并实现公平性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
证明承诺:一种以人为中心的资源用于无许可共识
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 证明承诺(PoCmt)通过实时人类参与的非并行化资源,提供了一种无许可共识机制,确保线性Sybil成本并实现公平性。
RoboReward: 通用视觉-语言奖励模型用于机器人学
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 RoboReward通过构建机器人奖励数据集和基准,训练视觉-语言奖励模型,验证了其在机器人学习中的有效性,并展示了改进策略学习和缩小与人工奖励差距的成果。
从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段
机构 * Roche(罗氏) ; Accenture(埃森哲) ; Involead
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG
AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。
Comments Contributed original research to top tier conference in VLM; currently undergoing peer review
MoIIE:多模态专家的混合模型用于大视觉语言模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institut(上海创新研究院) ; University of Southern California(南加州大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV
AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。
带有和不带上下文的指令微调:行为变化和下游影响
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Adobe Research(Adobe研究) ; KAIST AI(韩国科学技术院人工智能实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; NAVER Cloud AI(NAVER云人工智能)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本文研究了指令微调中带上下文与不带上下文对模型行为和下游性能的影响,发现上下文增强训练能提升模型基础性并减少幻觉,同时提出在实际部署中分离上下文模型以获得更稳健的性能。
3D-Agent:三模态多智能体协作用于可扩展的3D物体标注
机构 * Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; Snap Inc.(Snap公司)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 Tri MARF通过三模态多智能体协作提升大规模3D物体标注效率与精度
Comments Accepted at NeurIPS 2025
AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) ; University of Edinburgh(爱丁堡大学) ; University of Washington(华盛顿大学)
专题命中 VLM训练与架构 :LLaVA(abstract)
AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。
最短片段,最大显著性:通过关键时刻提取实现长视频摘要
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。