AI 集群佈線:數量、距離、傳輸介質與驗收
GPU 集群主要就是線纜。一個節點上 8 塊 GPU 意味著 8 條 400G(或 800G)scale-out 鏈路,外加管理和儲存鏈路;上千塊 GPU 意味著跨兩三層交換的上千個光端口,每一個都可能成為訓練中斷點。本頁把 GPU 組網 中的組網設計轉化為線纜數量、傳輸距離分類、連接器選型和安裝檢查清單。
統計鏈路數
以典型的 8-GPU 節點、每塊 GPU 一張 400G 網卡、rail-optimised 兩層組網為例:
| 項目 | 公式 | 1 024 塊 GPU(128 個節點) |
|---|---|---|
| GPU 到 leaf 鏈路 | GPU 數 × 1 | 1 024 × 400G |
| leaf 到 spine 鏈路(無阻塞) | = GPU 到 leaf | 1 024 × 400G |
| 光/線纜端口數(每條鏈路兩端) | 鏈路數 × 2 | 4 096 |
| 儲存 + 管理網卡 | 每節點 2–4 個 | 再加 256–512 條鏈路 |
| 備用光模組(3–5 %) | — | 150–250 |
採用 NDR 雙端口交換機模組(每個 OSFP 2 × 400G)時,交換機側的模組數量減半,但光纖數量不變。三層組網每 1 024 塊 GPU 還要再加 1 024 條 spine 到 core 鏈路。這些端口中的每一個都是一個具有身份資訊和 DDM 的光模組或線纜插頭(鏈路可靠性與監測)。
rail-optimised 佈局中的距離
| 段落 | 典型距離 | 介質 |
|---|---|---|
| GPU 網卡 → leaf,同機櫃 | ≤ 2 m | 無源 DAC(400G ≤ 2 m;800G ≤ 1–1.5 m)——最便宜、零功耗、較重 |
| GPU 網卡 → leaf,相鄰機櫃(rail 組跨一整排) | 3–10 m | AEC(≤ 3–5 m)或 AOC / 基於多模光纖的 SR 光模組 |
| leaf → spine,同機房 | 10–100 m | AOC 最長約 50–100 m;OM4 上的 SR4/SR8 / VR ≤ 50–100 m;SMF 上的 DR4/DR8 500 m——400G 以上 DR 更佔優 |
| spine → core / 機房之間 | 100 m – 2 km | DR4 / FR4 / 2×FR4 單模 |
| 樓宇間 DCI | 2–80 km | LR4、ZR/ZR+(相干與長距) |
rail-optimised 佈線把每個節點的 GPU i 都接到 leaf i,因此一個節點的 8 根線纜分散到 8 個不同的 leaf——大多數 GPU 到 leaf 鏈路要出機櫃,DAC 的佔比比經典 ToR 設計中要小。詳見 線纜內部結構。
連接器與光纖選型
| 光模組 | 連接器 | 光纖 | 說明 |
|---|---|---|---|
| 400G DR4 / 800G DR8 | MPO-12 APC / MPO-16 APC(或 2 × MPO-12) | SMF,Base-8/Base-16 | 單模並行鏈路全程使用 APC;模組端帶針,跳線端不帶針 |
| 400G/800G SR8 / VR8 | MPO-16 UPC | OM4/OM5 | 50–100 m;光模組便宜,但每米光纖成本更高 |
| 400G FR4 / 2×FR4 | 雙工 LC / 2 × LC | SMF | 光纖數量更少,WDM 在模組內部完成 |
| NDR 雙端口 OSFP | 2 × MPO-12 APC | SMF | 每個模組兩個邏輯端口;分支線纜 1:2 / 1:4(IB 佈線) |
| DAC / AEC | 無 | twinax | 兩端都有身份資訊 |
MPO 主幹全程採用極性方式 B;4 通道光模組使用 Base-8 主幹(拆分與 MPO 佈線)。
僅光模組自身的功耗與發熱
| 光模組 | 功耗 | 每台 64 端口交換機 |
|---|---|---|
| 400G DR4 QSFP-DD | 8–12 W | 0.5–0.8 kW |
| 800G DR8 / 2×FR4 OSFP | 14–18 W | 0.9–1.2 kW |
| 400G AOC 端口 | 3–5 W | — |
| 800G AEC 端口 | 4–6 W | — |
| DAC | 0 | — |
因此交換機面板需要無阻礙的前後風道;交換機上用帶散熱片的 OSFP,網卡上用平頂型;線纜捆紮不能擋住進風口(功耗與散熱、溫度與電壓)。在主機支援的情況下,線性(LPO)光模組可將模組功耗降低約一半(調制與 DSP)。
安裝與 QA 檢查清單
- 進料檢驗每一個光模組和線纜端口:身份資訊、校驗和、DDM 是否正常,保存基線(生產與測試)。
- 新光模組部署前在工作溫度下老化 24–72 小時。
- 安裝時檢查並清潔每個 MPO(APC 型號用 APC 探頭);絕不對接未檢查過的連接器。
- 標籤兩端:節點/GPU/網卡 ↔ leaf/端口;分支線纜逐支標註。
- 彎曲半徑與重量管理——DAC/AEC 用線槽和捆紮,光纖留服務餘量環。
- 開通驗證:每條鏈路滿速滿寬、FEC 開啟,每通道接收光功率與相鄰通道相差在 2 dB 以內,空閒時 pre-FEC 誤碼率 < 10⁻⁷ (VDM 與 FEC 指標)。
- 記錄每通道 DDM 和身份資訊到組網管理系統 / CMDB 中作為基線。
- 按介質類別和連接器準備備件,並保持其處於已老化狀態。
常見安裝故障
| 故障 | 特徵 |
|---|---|
| APC 型 DR4 上插了 UPC 跳線 | 兩端所有通道功率偏低 3–10 dB |
| 主幹極性接反 | 所有通道無光 |
| MPO 髒污 | 一兩個通道功率偏低;這些通道 pre-FEC 誤碼率高 |
| DAC 長度超出主機支援範圍 | 鏈路降速或頻繁掉線 |
| 分支線纜支路接錯 | 端口連到錯誤的對端;組網管理系統拓撲不匹配 |
| 帶散熱片的 OSFP 插入平頂籠子(或反之) | 插不到位 / 過熱 |
在 CodingBox 中
在這種規模下,進料檢驗是一套工作流,而不是抽檢:CodingBox 讀取每個模組或線纜端口,校驗身份資訊和校驗和,將實時每通道 DDM 記錄為基線,並按序號存入 代碼資料庫,這樣日後從頻繁掉線端口拔下的模組就能與它出廠第一天的狀態做比對。