DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts
DualKV: 面向高效RL训练的共享提示Flash注意力机制,支持大规模展开和长上下文
机构 * Amazon Web Services(亚马逊网络服务) ; Google(谷歌) ; University of Minnesota(明尼苏达大学)
AI总结 针对RL训练中共享提示重复计算问题,提出DualKV内核,通过融合CUDA前向/反向核和veRL数据流水线重排,消除提示复制,实现1.63-3.82倍策略更新加速。