Hierarchical Behaviour Spaces
层次行为空间
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of Oxford(牛津大学)
AI总结 本文提出层次行为空间(HBS)方法,通过线性组合奖励函数诱导行为空间,提升策略表达能力,在NetHack环境中验证了其性能,发现层级优势源于探索而非长期推理。
大厂专区
层次行为空间
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of Oxford(牛津大学)
AI总结 本文提出层次行为空间(HBS)方法,通过线性组合奖励函数诱导行为空间,提升策略表达能力,在NetHack环境中验证了其性能,发现层级优势源于探索而非长期推理。
质疑问题:在线辩论过程中的代表性审计
机构 * FAIR at Meta(Meta的FAIR)
AI总结 本文提出基于公正代表概念的审计框架,用于评估辩论过程中问题集的代表性,通过算法和历史数据验证了LLM在支持辩论过程中的潜力与局限。
探索第一人称视频理解中的音频幻觉
机构 * Meta ; University Of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。
Comments Accepted to ICASSP 2026
通过动态多模态检索个性化因果音频驱动面部运动
机构 * The University of Tokyo, Codec Avatars Lab, Meta(东京大学,Codec Avatars实验室,Meta) ; Codec Avatars Lab, Meta(Codec Avatars实验室,Meta)
AI总结 本文提出一种端到端的因果框架,通过动态多模态风格检索实现个性化因果面部运动生成,解决实时流媒体与高保真个性化之间的矛盾,提升低延迟并利用无结构风格参考。
管扩散策略:面向富接触操作的反应式视觉-触觉策略学习
机构 * Meta Reality Labs Research(Meta现实实验室) ; Idiap Research Institute(Idiap研究机构) ; École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) ; University of Toronto(多伦多大学) ; Purdue University(普渡大学)
AI总结 本文提出Tube Diffusion Policy,通过结合扩散模型与管反馈控制,解决富接触操作中对不确定性和高频触觉反馈的快速反应需求,实验验证其在多种任务中的优越性能。
奖励模型实际上是隐含的价值函数:时间一致的奖励建模
机构 * AI at Meta(Meta人工智能)
AI总结 本文提出时间一致的奖励建模方法,通过正则化项使奖励模型在任意token位置输出代表条件期望,提升token级奖励可解释性,并在ProcessBench上取得SOTA性能,同时优化PPO的资源利用。
Comments 27 pages, 14 figures
For-Value:高效前向仅数据估值用于微调LLM和VLM
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Meta
AI总结 本文提出For-Value框架,通过前向计算高效评估数据价值,无需反向传播,提升大规模模型训练效率。
MLorc: 动量低秩压缩用于内存高效的大型语言模型适应
机构 * University of Virginia(弗吉尼亚大学) ; National University of Singapore(新加坡国立大学) ; Meta ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出MLorc方法,通过压缩和重建矩阵参数动量以降低内存消耗,相比LoRA和GaLore在内存效率和训练动态保留方面更优,理论和实验均验证其有效性。
Comments AISTATS 2026