2026年8月,国产智算领域硬件规格再次刷新。真武 M890 超节点正式上线,并完成了 2.4 万亿参数大模型 Qwen3.8-Max 的运行测试。这一进展展示了国产智算架构在处理超大规模参数模型时的技术路径演进。

对于 AI 开发者与架构师而言,万亿级模型的训练与推理对底层硬件提出了极高要求。本文将解析真武 M890 的 64 卡架构与 9TB 显存的技术逻辑,探讨其如何通过解决“显存墙”问题支撑超大模型运行。

概念解析:什么是“超节点”?

在理解真武 M890 之前,需明确 “超节点(Super Node)” 与传统 AI 集群的区别。

传统 AI 算力集群多采用横向扩展 Scaleout:通过 RoCE / InfiniBand 交换机,把多台 8 卡、16 卡服务器互联。但模型规模暴涨之后,大量张量、专家路由需要跨物理机传输,跨节点网络通信延迟会成为整体算力瓶颈。

智算超节点侧重于纵向扩展 Scaleup:依靠自研 ICN Switch 高速互联芯片,把数十张 AI 加速卡整合为单一逻辑计算单元,实现卡间显存统一寻址。大量原本需要跨物理服务器的数据交互,在超节点内部高速总线上完成,从物理层面降低通信开销。
补充:超节点并非完全替代横向扩展;多套 M890 超节点之间依然支持 Scaleout 互联,面向十万亿以上超大规模任务继续向外扩展。

技术拆解:64卡架构与9TB显存的逻辑

超大模型训练中,模型权重、优化器状态、梯度及 KV Cache 对显存容量和带宽的消耗极大。

真武 M890 配置的 9TB 显存构建了一个巨大的“显存池”,能够直接容纳超大模型的完整参数。在传统的 8 卡集群中,为了运行万亿参数模型,必须频繁使用张量并行、流水线并行等策略将模型切分到不同物理机,这会产生显著的跨机通信开销。而在 64 卡超节点内,更大比例的张量并行(Tensor Parallelism)可以在单一节点内闭环,从而降低延迟。

注意:9TB 是 64 张加速卡聚合总显存,并非单卡显存;单张真武 M890 芯片自带 144GB HBM 显存。

维度 传统 8 卡 AI 物理服务器集群 真武 M890 64 卡逻辑超节点
架构模式 Scaleout(多服务器横向扩展) Scaleup(节点内高密度纵向扩展,同时支持多超节点再 Scaleout)
单单元总显存 单台服务器:640GB1.5TB 64 卡逻辑单元合计:9TB 统一寻址显存
节点内通信 PCIe / 传统 NVLink ICN Switch 1.0 高速互联总线
跨节点通信依赖 高,强依赖外部交换机光模块 大幅降低,绝大多数 MoE 专家交互在节点内完成
通信延迟 较高,受网卡与路由约束 极低,节点内显存直通高速互联

实战背景:Qwen3.8-Max 的运行需求

Qwen3.8Max 属于 MoE 混合专家架构,总参数 2.4 万亿,但单次推理仅激活约 950 亿参数,推理阶段并不会把全部 2.4T 权重全部加载进显存;只有全量训练、全专家参与计算场景,才需要承载全部总参数权重。

  • 训练场景:全专家参与计算,模型权重、优化器状态、梯度叠加,整体显存压力极大;9TB 聚合显存可以承载完整 4T 总参数相关数据,减少频繁显存交换。
  • 推理场景:依靠 MoE 稀疏激活特性,仅加载被激活专家,配合 M890 原生 FP8/FP4 低精度能力,进一步降低显存压力,同时处理长上下文带来的海量 KV Cache。

真武 M890 的 64 卡高速互联,缓解 MoE 专家并行场景下的微批次气泡问题,提升有效算力利用率(MFU)。

业务落地提醒:64 卡 M890 超节点为整机最小售卖单元,不可拆分单卡使用;同时需要大模型框架深度适配 MoE 专家调度,并非上传模型即可直接运行。

行业趋势:向“超大单体节点”演进

真武 M890 的出现反映了国产智算算力架构的一个趋势:随着多模态模型和长上下文(Long-Context)需求的增加,传统的 Scale-out 架构在处理海量 KV Cache 时面临挑战。

从“堆叠节点”向“超大单体节点(Scale-up)”演进,通过提升单节点的计算密度和互联带宽,正在成为解决超大模型训练与高并发推理的路径之一。这种架构演进将为自动驾驶、AI 制药等需要高算力密度的场景提供底层支持。

常见问题 (FAQ)

Q:什么是智算超节点,与传统 AI 服务器有何区别? A:智算超节点(Super Node)通过自研高速互联芯片,将数十张 AI 加速卡组成一个逻辑整机,实现显存统一寻址。对比传统多台 8 卡服务器集群,它优先放大 Scaleup 纵向扩展收益,把大量计算交互收敛在节点内部,减少跨物理服务器网络通信损耗;超节点之间依然可以继续横向 Scaleout 组网。

Q:真武 M890 的 64 卡架构如何解决大模型训练的显存瓶颈? A:真武 M890 提供 64 卡合计 9TB 池化聚合显存;针对 MoE 模型优势尤其明显,专家并行 EP、张量并行 TP 大量在节点内闭环,依靠 ICN Switch 高速互联替代高延迟跨机网络,缓解 “显存墙” 与网络带宽约束。

Q:运行 2.4 万亿总参数 Qwen3.8Max 需要多大算力显存?推理也需要全部 2.4T 权重载入显存吗? A:Qwen3.8Max 为 MoE 混合专家模型,分两种场景:

  1. 全量训练场景:BF16 下全部 4T 总参数量权重约占用 4.8TB 显存,叠加优化器状态、梯度、激活,总显存需求会超过 8TB,需要 9TB 级别聚合显存单元支撑。
  2. 线上推理场景:依靠 MoE 稀疏激活,每次仅激活约 95B 专家参数,不需要完整加载全部 4T 权重;配合 FP8/FP4 量化可进一步降低显存占用。

相关新闻

联系我们

联系我们

电报:@yilongcloud

邮件:yilongcloud@hotmail.com

工作时间:早上8:00-晚上11:00

认准电报
认准电报
分享本页
返回顶部