arXivDaily arXiv每日学术速递 周一至周五更新

作者

Chelsea Finn

Robotics / Machine Learning

2026-04-21 至 2026-04-21 共收录 2
2604.17654 2026-04-21 cs.AI

Poly-EPO: Training Exploratory Reasoning Models

Poly-EPO:训练探索性推理模型

Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam, Shirley Wu, Hengyuan Hu, Noah Goodman, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08812 2026-04-21 cs.LG

Test-Time Alignment via Hypothesis Reweighting

测试时对齐 via 假设重加权

Yoonho Lee, Jonathan Williams, Henrik Marklund, Archit Sharma, Eric Mitchell, Anikait Singh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

AI总结 本文提出HyRe方法,通过重加权集成成员实现实时个性化,仅需1-5个标记示例即可超越现有奖励模型。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏