arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-11 至 2026-05-11 共收录 5
2605.08044 2026-05-11 cs.CL cs.AI cs.LG

Fast Byte Latent Transformer

快速字节潜在变换器

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00338 2026-05-11 cs.LG cs.AI

Scalable Option Learning in High-Throughput Environments

高吞吐环境下的可扩展选项学习

Mikael Henaff, Scott Fujimoto, Michael Matthews, Michael Rabbat

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of Oxford(牛津大学)

AI总结 本文提出SOL算法,通过高吞吐量的层级强化学习方法,在NetHack等复杂游戏中实现35倍的吞吐量提升,验证了其在高吞吐环境中的扩展性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05687 2026-05-11 cs.RO

Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding

接触导向策略:具备生成接触基础的灵活视觉-触觉策略

Zhengtong Xu, Yeping Wang, Ben Abbatematteo, Jom Preechayasomboon, Sonny Chan, Nick Colonnese, Amirhossein H. Memar

机构 * Purdue University(普渡大学) Meta Reality Labs Research(Meta现实实验室) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08638 2026-05-11 cs.CV cs.AI

Into the Rabbit Hull: From Task-Relevant Concepts in DINO to Minkowski Geometry

进入兔皮:从DINO中的任务相关概念到闵可夫斯基几何

Thomas Fel, Binxu Wang, Michael A. Lepori, Matthew Kowal, Andrew Lee, Randall Balestriero, Sonia Joseph, Ekdeep S. Lubana, Talia Konkle, Demba Ba, Martin Wattenberg

机构 * Kempner Institute, Harvard University(哈佛大学凯姆纳研究所) Harvard University(哈佛大学) Dept. of Psychology, Harvard University(哈佛大学心理学系) Brown University(布朗大学) Google DeepMind(谷歌DeepMind) Meta Goodfire

AI总结 本文通过分析DINOv2的任务相关概念,揭示了其在分类、分割和深度估计中的功能专业化,并提出闵可夫斯基表示假设以解释视觉Transformer的表示结构。

Comments Accepted at ICLR 2026

Journal ref ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21183 2026-05-11 cs.LG cs.AI cs.CL

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

MaPPO:结合先验知识的最大后验偏好优化

Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Meta, FAIR Yonsei University(延世大学)

AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏