AWS Machine Learning Blog· Ashvin Nihalani·· 6 天前AI 评分35
在 Amazon EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput
AI 导读
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
来源:AWS Machine Learning Blog · aws.amazon.com