arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Moonshot AI(月之暗面)

2026-04-06 至 2026-04-06 共收录 2
2604.02349 2026-04-06 cs.LG cs.AI

OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration

OPRIDE: 通过数据集内探索实现离线偏好驱动强化学习

Yiqin Yang, Hao Hu, Yihuan Mao, Jin Zhang, Chengjie Wu, Yuhua Jiang, Xu Yang, Runpeng Xie, Yi Fan, Bo Liu, Yang Gao, Bo Xu, Chongjie Zhang

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Tsinghua University(清华大学) Moonshot AI(月之暗面) Amazon(亚马逊) University of Arizona(亚利桑那大学) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 本文提出OPRIDE算法,通过改进探索策略和折扣调度机制提升离线偏好驱动强化学习的查询效率,实验表明其在多种任务中表现优异。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14617 2026-04-06 cs.DC cs.LG

Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning

Seer:在线上下文学习用于快速同步LLM强化学习

Ruoyu Qin, Weiran He, Weixiao Huang, Yangkun Zhang, Yikai Zhao, Bo Pang, Xinran Xu, Yingdi Shan, Yongwei Wu, Mingxing Zhang

机构 * Moonshot AI(月之暗面) Tsinghua University(清华大学)

AI总结 Seer通过动态负载均衡、上下文感知调度和自适应分组推测解码技术,显著降低长尾延迟并提升资源利用率,实现2.04倍的端到端效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏