Value Flows
Value Flows
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 本文利用基于流的生成模型估计完整未来回报分布,通过新的流匹配目标满足分布贝尔曼方程,并利用流导数ODE估计回报不确定性以优先学习,在离线与在线设置中平均成功率提升1.3倍。
Comments ICLR 2026
作者
Robotics / Machine Learning
Value Flows
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 本文利用基于流的生成模型估计完整未来回报分布,通过新的流匹配目标满足分布贝尔曼方程,并利用流导数ODE估计回报不确定性以优先学习,在离线与在线设置中平均成功率提升1.3倍。
Comments ICLR 2026