本文由 阿里云国际站代理商『翼龙云/TG @Yilongcloud 撰写』如需转载请注明!
万亿参数规模下,MoE(Mixture of Experts,混合专家)架构凭借 “大参数、小计算量” 的特性,已成为当前大模型的主流演进方向。然而,这种稀疏激活机制在提升推理效率的同时,也对底层 AI 算力基础设施的显存容量和网络带宽提出了更高要求。 本文将分析 MoE 训练中的通信难题,并解析阿里云真武 M890 超节点(64 卡高速互联)如何通过架构重构解决这些瓶颈。
说明:本文基于 2026 年 8 月阿里云灵骏国内产品信息整理;真武 M890 超节点 GP9A 当前仅国内乌兰察布地域开放,阿里云国际站暂未上线该规格;硬件规格、准入政策、资源库存持续调整,最终方案请以阿里云官方最新信息为准。
1. MoE 架构的技术代价:显存墙与通信压力
MoE 架构通过路由机制(Router)将 Token 分发给特定的 “专家” 网络处理。虽然每次仅激活部分参数,但为了保证训练效率,所有专家参数通常需要常驻显存。
这带来了两个核心挑战:
显存容量限制:万亿参数模型的专家总量巨大,单张 PPU 显存无法承载,必须依赖专家并行(Expert Parallelism)等策略将模型切分到大量加速卡上。
All-to-All 通信瓶颈:在专家并行模式下,不同专家分布在不同 PPU 上。Router 分发 Token 以及处理后结果的回传,会产生大量不规则突发 All-to-All 通信。当通信带宽无法匹配计算速度时,PPU 就会因等待数据而出现闲置,算力利用率持续下滑。
补充关键特征:稠密大模型以规整 AllReduce 通信为主;MoE 的 All-to-All 流量分布随机,极易在传统网络架构中形成热点拥塞,也就是行业常说的 “通信墙”。
2. 传统“8 卡节点”的局限性
行业主流 NVIDIA 8 卡集群架构:单机内部依靠 NVLink 实现高速互通,跨物理节点数据交换依托 IB/RoCE RDMA 网络。 节点内部带宽与跨节点带宽存在数量级差距。对于 MoE 模型训练,一旦 All-to-All 数据交互跨越物理服务器,海量 Token 交换极易造成网络拥堵。 此时单纯增加服务器横向扩容,无法带来线性训练加速,额外新增的算力会被通信延迟抵消,整体集群算力利用率不断降低。
3. 阿里云真武 M890 超节点架构解析
针对上述瓶颈,真武 M890 超节点将单集群 Scale-up(向上扩展)高速通信域,从传统单机 8 卡提升至 64 卡。整套体系采用平头哥自研真武 PPU 加速卡、ICN Switch 1.0 全域互联、配套 PCCL 集合通信库,和 NVIDIA 软硬件生态无法直接兼容。
其核心技术逻辑包括:
扩展高速互联域 :
依托机架级自研 ICN 高速交换拓扑,真武 M890 将 64 张 PPU 纳入同一个无阻塞、低延迟、高带宽统一通信域。大量原本需要跨物理机转发的数据交互,可以在超节点通信域内部完成,规避低速跨实例网络。
优化 MoE All-to-All 通信效率 :
在 64 卡超大互联域内部署 MoE 模型,更多专家网络可以就近放置在同一通信平面。Token 路由分发、结果回传依托超节点内部高带宽链路,大幅降低对外网 RDMA 链路的依赖,缓解突发流量拥塞。
聚合显存池化能力 :
整套 64 卡架构形成超大聚合显存池(总显存 9TB),能够承载规模更大的专家组,减少因为显存不足被迫频繁跨节点切分专家参数,进一步削减跨机通信频次。
4. 技术对比:传统 8 卡 vs 真武 M890 64 卡
| 维度 | 传统 NVIDIA 8 卡节点集群 | 灵骏真武 M890 64 卡 PPU 超节点 |
| 单节点加速卡规模 | 8 张 GPU | 64 张真武 PPU 加速卡 |
| 内部高速互联 | 单机 NVLink 互通,跨节点依靠 RDMA/IB | ICN Switch 1.0,64 卡全域统一高速通信域 |
| 集合通信库 | NCCL | PCCL(自研,参数不可直接复用 NCCL) |
| 通信短板 | 跨物理节点 All-to-All 带宽落差大,MoE 训练易出现网络热点拥塞 | 64 卡域内低延迟互通,大量专家流量无需跨实例转发 |
| 聚合显存上限 | 受限于单机 8 张 HBM 容量 | 64 卡聚合 9TB 统一显存池 |
| 适配模型规模 | 百亿~千亿参数稠密模型、小规模 MoE | 千亿~十万亿参数大规模 MoE、多智能体强化学习、超大规模离线推理 |
| 典型局限 | 横向扩容后通信墙快速凸显 | 准入门槛高,最小售卖单元为完整 64 卡,不适合小规模短期实验 |
5. 适用场景与误区说明
适用场景:
真武 M890 超节点适用于千亿至十万亿参数规模 MoE 大模型预训练、超大规模分布式 MoE 推理、海量智能体集群强化学习,以及对节点内 All-to-All 通信带宽高度敏感的科研仿真任务。
常见误区:
单纯增加加速卡数量不等于训练加速。分布式训练效率核心在于计算与通信平衡。如果底层互联架构无法承载 MoE 海量不规则数据交换,新增算力会被通信延迟吞噬。超节点核心价值就是扩大高速通信域,保障横向扩展的有效算力增益。
并非所有大模型训练都需要 64 卡超节点。70B 以内稠密模型、小规模 MoE 训练,常规灵骏 PPU 实例性价比更高;小规模算法验证不建议直接采购 M890。
配套建议:大规模 MoE 训练建议同步部署 CPFS for Lingjun 灵骏专属并行文件系统,解决数据集读取、Checkpoint 频繁写入带来的 IO 瓶颈。
常见问题 (FAQ)
Q1:MoE 大模型训练为什么容易遇到通信瓶颈?
MoE 架构依靠路由机制分发 Token。分布式训练场景下,各个专家网络分散在不同加速卡上,持续产生大量不规则 All-to-All 数据交互。当网络带宽不足以承载突发流量,加速卡长时间等待数据传输,算力利用率下降,形成明显通信瓶颈。
Q2:阿里云真武 M890 超节点 64 卡互联方案有什么技术优势?
该方案突破传统单机 8 卡通信域限制,将 64 张真武 PPU 纳入同一 ICN 全域高速互联平面。大量原本跨物理节点的慢速通信转化为超节点内部高速数据交换,同时拥有超大聚合显存,缓解大规模 MoE 训练过程中的网络拥塞问题。
Q3:单节点 64 卡架构如何提升大模型训练效率?
在 64 卡统一通信域内,MoE 专家组可以就近部署。执行专家并行训练时,绝大多数 Token 路由、数据交换在低延迟内部链路完成,减少对外跨实例网络依赖,有效提升 PPU 算力利用率(MFU),缩短完整训练周期。
Q4:M890 超节点可以拆分 32 卡 / 16 卡做小规模测试吗?
GP9A 真武 M890 最小售卖单元为整套 64 卡超节点,暂不支持拆分采购。算法原型调试、小规模实验建议选用常规灵骏 PPU 实例先行验证方案。
