arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-04-28 至 2026-04-28 共收录 8
2604.24558 2026-04-28 cs.AI cs.LG

Hierarchical Behaviour Spaces

层次行为空间

Michael Tryfan Matthews, Anssi Kanervisto, Jakob Foerster, Pierluca D'Oro, Scott Fujimoto, Mikael Henaff

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of Oxford(牛津大学)

AI总结 本文提出层次行为空间(HBS)方法,通过线性组合奖励函数诱导行为空间,提升策略表达能力,在NetHack环境中验证了其性能,发现层级优势源于探索而非长期推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04588 2026-04-28 cs.AI cs.CY

Question the Questions: Auditing Representation in Online Deliberative Processes

质疑问题:在线辩论过程中的代表性审计

Soham De, Lodewijk Gelauff, Ashish Goel, Smitha Milli, Ariel Procaccia, Alice Siu

机构 * FAIR at Meta(Meta的FAIR)

AI总结 本文提出基于公正代表概念的审计框架,用于评估辩论过程中问题集的代表性,通过算法和历史数据验证了LLM在支持辩论过程中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23692 2026-04-28 cs.GR cs.CV

Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval

通过动态多模态检索个性化因果音频驱动面部运动

Xuangeng Chu, Yu Han, Wei Mao, Shih-En Wei

机构 * The University of Tokyo, Codec Avatars Lab, Meta(东京大学,Codec Avatars实验室,Meta) Codec Avatars Lab, Meta(Codec Avatars实验室,Meta)

AI总结 本文提出一种端到端的因果框架,通过动态多模态风格检索实现个性化因果面部运动生成,解决实时流媒体与高保真个性化之间的矛盾,提升低延迟并利用无结构风格参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23609 2026-04-28 cs.RO

Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation

管扩散策略:面向富接触操作的反应式视觉-触觉策略学习

Teng Xue, Alberto Rigo, Bingjian Huang, Jiayi Shen, Zhengtong Xu, Nick Colonnese, Amirhossein H. Memar

机构 * Meta Reality Labs Research(Meta现实实验室) Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) University of Toronto(多伦多大学) Purdue University(普渡大学)

AI总结 本文提出Tube Diffusion Policy,通过结合扩散模型与管反馈控制,解决富接触操作中对不确定性和高频触觉反馈的快速反应需求,实验验证其在多种任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22981 2026-04-28 cs.LG

Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling

奖励模型实际上是隐含的价值函数:时间一致的奖励建模

Alex Nikulkov

机构 * AI at Meta(Meta人工智能)

AI总结 本文提出时间一致的奖励建模方法,通过正则化项使奖励模型在任意token位置输出代表条件期望,提升token级奖励可解释性,并在ProcessBench上取得SOTA性能,同时优化PPO的资源利用。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10180 2026-04-28 cs.CL

For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs

For-Value:高效前向仅数据估值用于微调LLM和VLM

Wenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos Thrampoulidis, Boying Gong, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Meta

AI总结 本文提出For-Value框架,通过前向计算高效评估数据价值,无需反向传播,提升大规模模型训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01897 2026-04-28 cs.LG cs.IT math.IT math.OC

MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation

MLorc: 动量低秩压缩用于内存高效的大型语言模型适应

Wei Shen, Zhang Yaxiang, Minhui Huang, Mengfan Xu, Jiawei Zhang, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) National University of Singapore(新加坡国立大学) Meta University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出MLorc方法,通过压缩和重建矩阵参数动量以降低内存消耗,相比LoRA和GaLore在内存效率和训练动态保留方面更优,理论和实验均验证其有效性。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏