arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-07 至 2026-08-07 共收录 3
2608.05446 2026-08-07 cs.LG cs.CL 新提交

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29806 2026-08-07 cs.LG cs.AI 版本更新

Accelerating Q-learning through Efficient Value-Sharing across Actions

通过跨动作的高效值共享加速Q学习

Prabhat Nagarajan, Brett Daley, Martha White, Marlos C. Machado

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute(阿尔伯塔人工智能研究所) Meta

AI总结 提出均值扩展层,通过跨动作共享值和学习低范数表示来加速动作值学习,在深度Q网络和隐分位数网络上提升Atari游戏性能并减少过估计。

Comments ICML 2026 (Spotlight); Adaptive and Learning Agents workshop 2026 (Best paper runner-up)

详情

展开后加载摘要…

URL PDF HTML 收藏