arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Huawei(华为)

2026-08-13 至 2026-08-13 共收录 1
2512.06547 2026-08-13 cs.LG cs.AI cs.DC 版本更新

A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation

A-3PO:通过意识滞后的近端策略优化加速异步大语言模型训练

Xiaocan Li, Shiliang Wu, Zheng Shen

机构 * Huawei Canada(华为加拿大)

AI总结 A-3PO通过近似近端策略优化方法,减少大语言模型异步训练中的计算开销,实现1.8倍的加速同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏