跳到正文
原文
AWS Machine Learning Blog· Ashvin Nihalani·· 6 天前AI 评分35

在 Amazon EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%

Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput

AI 导读

AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。

来源:AWS Machine Learning Blog · aws.amazon.com