让收发器匹配拓扑
MGX 支持 Base-8(SR8/DR8)、Base-16 和 Base-24 MPO/MTP® 连接。Base-8 主导 800G 部署。Base-16 和 Base-24 在 1.6T 和 3.2T 时代涌现,在不牺牲通道密度的情况下减少连接器数量并简化线缆管理。
MGX —— 面向 AI 训练和推理的模块化 GPU X 参考设计。Base-8 至 Base-24 连接。800G 至 3.2T 通道速率,轨道优化、正面访问、可扩展。
MGX (Modular GPU X) 是在标准机架外形中部署 GPU 密集型计算的参考架构。它定义了 sled、机架布局和网络拓扑 —— 但不定义布线。一个典型的 MGX 机架容纳 9 个 AI 节点, 每个节点 8 个 GPU,外加位于节点之间的叶节点交换机。 GPU 通过高带宽链路进行芯片间通信;节点通过光学骨干网络进行机架间通信。随着通道速率从 800G 上升至 1.6T 并迈向 3.2T,物理层从铜缆转向共封装光学,再转向外部光纤 —— 使光学连接策略成为集群性能的决定性因素。
MGX 支持 Base-8(SR8/DR8)、Base-16 和 Base-24 MPO/MTP® 连接。Base-8 主导 800G 部署。Base-16 和 Base-24 在 1.6T 和 3.2T 时代涌现,在不牺牲通道密度的情况下减少连接器数量并简化线缆管理。
在轨道优化架构中,800G 或 1.6T 链路的 8 条通道分布于独立交换机轨道。单个光模块故障仅导致 12.5% 或 25% 带宽下降 —— 而非 100% 中断。集群继续训练。维护等待您的计划,而非作业队列。
MGX sled 将正面留给 ELS 可插拔模块、环回测试和热管理。所有高芯数干线通过后部盲插或直通光纤母线排迁移。这保留了正面气流和可维护性,同时在后部管理巨大的骨干光纤数量。
共封装光学(CPO)和近封装光学(NPO)将光学引擎置于 ASIC 之上或邻近位置,相比传统可插拔收发器降低功耗和延迟。MGX 同时容纳两者:正面 ELS 可插拔模块提供灵活性,后部无源光纤模块实现 CPO 背板集成。
机架布局
Generic rack elevation · rear fiber paths · no vendor logos
分布式 AI 训练需要跨数千 GPU 的纳秒级同步。光纤本身的传播延迟 —— 不仅是收发器 —— 成为瓶颈。更低延迟的光纤技术和更短、预验证的光学路径直接改善模型收敛时间。
一台满载的 MGX 机架在 GPU、叶节点交换机和骨干上行之间可能需要超过 1,000 条光纤通道。用传统跳线管理这些会制造阻塞气流的线缆巢并增加变更维护复杂度。轨道优化跳线架构和后置光纤母线排以工厂验证路径替代手动跳接。
在标准点对点网络中,一个光模块故障即可中断整个训练任务。轨道优化跳线架构将通道分布于独立轨道,使单点故障仅导致部分带宽下降,而非灾难性损失。物理层保护工作负载。