一种架构,任意规模

MGX —— 面向 AI 训练和推理的模块化 GPU X 参考设计。Base-8 至 Base-24 连接。800G 至 3.2T 通道速率,轨道优化、正面访问、可扩展。

信息参考

NVIDIA / OCP 生态系统

01

模块化设计
光学连接是必然选择

MGX (Modular GPU X) 是在标准机架外形中部署 GPU 密集型计算的参考架构。它定义了 sled、机架布局和网络拓扑 —— 但不定义布线。一个典型的 MGX 机架容纳 9 个 AI 节点, 每个节点 8 个 GPU,外加位于节点之间的叶节点交换机。 GPU 通过高带宽链路进行芯片间通信;节点通过光学骨干网络进行机架间通信。随着通道速率从 800G 上升至 1.6T 并迈向 3.2T,物理层从铜缆转向共封装光学,再转向外部光纤 —— 使光学连接策略成为集群性能的决定性因素。

02

核心架构原则

01

让收发器匹配拓扑

MGX 支持 Base-8(SR8/DR8)、Base-16 和 Base-24 MPO/MTP® 连接。Base-8 主导 800G 部署。Base-16 和 Base-24 在 1.6T 和 3.2T 时代涌现,在不牺牲通道密度的情况下减少连接器数量并简化线缆管理。

02

一次故障,无需整机停机

在轨道优化架构中,800G 或 1.6T 链路的 8 条通道分布于独立交换机轨道。单个光模块故障仅导致 12.5% 或 25% 带宽下降 —— 而非 100% 中断。集群继续训练。维护等待您的计划,而非作业队列。

03

保持正面自由

MGX sled 将正面留给 ELS 可插拔模块、环回测试和热管理。所有高芯数干线通过后部盲插或直通光纤母线排迁移。这保留了正面气流和可维护性,同时在后部管理巨大的骨干光纤数量。

04

让光学引擎更靠近

共封装光学(CPO)和近封装光学(NPO)将光学引擎置于 ASIC 之上或邻近位置,相比传统可插拔收发器降低功耗和延迟。MGX 同时容纳两者:正面 ELS 可插拔模块提供灵活性,后部无源光纤模块实现 CPO 背板集成。

03

9 个节点,72 个 GPU。骨干在外部

机架布局

  • 1 台 MGX 机架容纳 9 个 AI 节点
  • 每个节点 = 8 个 GPU(上 4 下 5)
  • 叶节点交换机位于 AI 节点之间
AI 节点后部接口
  • 8× GPU C2C (芯片到芯片)
  • 2× 前端接口
  • 1× 带内管理
叶节点交换机
  • 每 2RU 144 个端口
  • 72 个端口连接 GPU(下行)
  • o72 个端口连接骨干网络(上行,机架外部)
04

为何光学层至关重要

01

每纳秒价值百万

分布式 AI 训练需要跨数千 GPU 的纳秒级同步。光纤本身的传播延迟 —— 不仅是收发器 —— 成为瓶颈。更低延迟的光纤技术和更短、预验证的光学路径直接改善模型收敛时间。

02

单机架容纳 1000 芯

一台满载的 MGX 机架在 GPU、叶节点交换机和骨干上行之间可能需要超过 1,000 条光纤通道。用传统跳线管理这些会制造阻塞气流的线缆巢并增加变更维护复杂度。轨道优化跳线架构和后置光纤母线排以工厂验证路径替代手动跳接。

03

故障不中断训练

在标准点对点网络中,一个光模块故障即可中断整个训练任务。轨道优化跳线架构将通道分布于独立轨道,使单点故障仅导致部分带宽下降,而非灾难性损失。物理层保护工作负载。

05

架构治理

NVIDIA MGX 参考设计 OCP ORv3 / ORW OCP NIC 3.0 IEEE 802.3 (800G/1.6T) InfiniBand NDR / XDR

连接 MGX 层?

ADTEK 提供与 MGX 及 ORv3 机架架构集成的轨道优化跳线模块、后置光纤母线排及盲插光学背板。与我们的工程团队讨论您的 GPU 集群连接策略。