AI 網絡概覽
訓練大型 AI 模型把計算負載分攤到許多伺服器上的許多塊 GPU 上。它們之間的網絡——而不是任何一塊單獨的 GPU——往往決定了集群的訓練速度,這也是 AI 組網傾向於使用能獲得的頻寬最高的光模組的原因。
為甚麼網絡至關重要
- 集合操作——GPU 之間持續以 all-to-all 模式交換梯度和參數,產生大量 東西向流量。
- 尾延遲至關重要——每一步都要等待最慢的鏈路,因此穩定的低延遲和無損傳輸是必須的。
- 規模——數千塊 GPU 意味著高密度、高基數的交換機以及龐大的光模組數量。
兩種組網方式
- InfiniBand——在 HPC 領域歷史悠久,具備 RDMA 和無損流控(見 InfiniBand)。
- 帶 RoCE 的以太網——即融合以太網上的 RDMA,在大規模 AI 場景中的應用日益增多,運行在無損以太網上。
光模組
AI 鏈路通常是 400G 和 800G,採用 QSFP-DD 和 OSFP 模組。具體的互連方案和光模組選型見 AI 互連與光模組。
同樣的封裝形式和管理記憶體在這裏同樣適用——CodingBox 讀取這些高速模組的方式與其他模組並無不同。
延伸閱讀
- AI 集群佈線——每塊 GPU 的鏈路數、 rail-optimised 佈局中的距離、DAC/AEC/AOC/DR 組合、連接器選型、光模組功耗、安裝 QA。
- AI 組網中的鏈路可靠性與監測—— 為甚麼一條鏈路會拖垮整個任務、FIT 算法、預測性指標、監測架構、隔離與預防。