Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
注入噪声的流匹配用于离线到在线强化学习
机构 * KAIST(韩国科学技术院)
AI总结 本文提出FINO方法,通过注入噪声的流匹配提升离线到在线强化学习的样本效率,结合熵引导采样平衡探索与利用,实现更高效的策略优化。
Comments ICLR 2026 camera-ready
高校专区
注入噪声的流匹配用于离线到在线强化学习
机构 * KAIST(韩国科学技术院)
AI总结 本文提出FINO方法,通过注入噪声的流匹配提升离线到在线强化学习的样本效率,结合熵引导采样平衡探索与利用,实现更高效的策略优化。
Comments ICLR 2026 camera-ready
流Actor-Critic用于离线强化学习
机构 * KAIST(韩国科学技术院) ; UNIST(全南大学)
AI总结 本文提出流Actor-Critic方法,通过结合流模型提升离线强化学习中策略的表达能力,以应对复杂多模式数据分布,实现新的性能突破。
Comments Accepted to ICLR 2026
通过灵活可信深度学习进行不确定性估计
机构 * Department of Industrial and Systems Engineering, KAIST(工业与系统工程系,韩国科学技术院)
AI总结 本文提出灵活可信深度学习(F-EDL),通过预测灵活的Dirichlet分布来提升不确定性量化在复杂和挑战性场景中的性能。
Comments NeurIPS 2025
ChoiceMates: 通过多智能体对话交互支持陌生在线决策
机构 * University of California, San Diego(加州大学圣迭戈分校) ; School of Computing, KAIST(韩国科学技术院计算机学院) ; Information and Interaction Design, Yonsei University(延世大学信息与交互设计) ; Hong Kong University of Science(香港科学大学)
AI总结 ChoiceMates通过多智能体对话交互帮助用户更高效地进行陌生在线决策。
Comments Accepted to IUI 2026