AWS 在 EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
AWS 机器学习博客介绍了一种在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,声称吞吐量提升 40%。文章指出大规模 RLHF/GRPO 训练面临 rollout 生成与策略训练资源竞争、计算/内存/带宽平衡、以及从节点内 NVLink 到节点间低带宽通信转变三大挑战,其中专家并行(EP)的动态 all-to-a
AWS 机器学习博客介绍了一种在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,声称吞吐量提升 40%。文章指出大规模 RLHF/GRPO 训练面临 rollout 生成与策略训练资源竞争、计算/内存/带宽平衡、以及从节点内 NVLink 到节点间低带宽通信转变三大挑战,其中专家并行(EP)的动态 all-to-a
AWS 博客介绍在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL 进行多模态强化学习训练。方案以 Qwen3-VL-8B 视觉语言模型为策略模型,采用 GRPO 算法训练其走 2D 迷宫,从 VisGym SFT 检查点出发,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。HyperP
AWS 博客介绍 NarrateAI 在 Amazon Bedrock 上为高管业务评审提供生产级 LLM 质量保障,服务超过 4000 名 AWS 高管。文章详述五种协同技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,实现约 99% 的数值准确率并支持实时流式响应。
AWS 博客介绍如何在 Amazon SageMaker AI 上通过 JumpStart 部署阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,实现实时语音克隆。该模型支持 10 种语言和跨语言克隆,仅需几秒参考音频即可复刻说话人音色,无需重新训练。部署采用 vLLM-Omni 容器和全托管实时推理端点,用户可