Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions
面向组合动作强化学习的潜在球形流策略
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出LSFlow方法,通过球形流匹配在紧凑连续潜在空间中学习随机策略,并利用组合优化求解器保证动作可行性,引入平滑贝尔曼算子解决不连续值函数问题,在多个组合RL任务上平均超越基线20.6%。
Comments ICML'26 Spotlight