CodingBox 說明文件

AI 集群中的光模組

AI 訓練集群是有史以來對高速光模組需求最大的場景,它們在速率、功耗和數量上都把模組推向極限。真正重要的工程問題,不是某一條鏈路本身,而是如何讓成千上萬條鏈路穩定運行。

使用哪些光模組

角色模組典型 PMD連接器
GPU 伺服器 ↔ leaf(scale-out,IB NDR)OSFP 雙端口 2×400GDR4 ×22 × MPO-12 APC
GPU 伺服器 ↔ leaf(以太網)QSFP-DD / OSFP 400G–800GDR4、DR8、2×FR4MPO-12/16 APC,雙 LC
leaf ↔ spine800G OSFP / QSFP-DD800DR8、2×FR4MPO-16 APC,雙 LC
機櫃內短距跳段傳輸距離允許時用 DAC / AOC

單模 DR 光模組佔主導地位,因為它們的傳輸距離達到 500 m——足夠覆蓋任何機房——並且能在同一套光纖基礎設施上從 400G 平滑升級到 800G。必須使用斜面 APC 連接器。

功耗與發熱

一個 800G 模組的功耗約為 14–18 W;一台 64 端口交換機面板上的光模組總功耗達千瓦級。OSFP 自帶散熱片,因此更適合最熱的模組;QSFP-DD 依賴主機散熱。熱降速——模組過熱時自動降級——是間歇性 400G/800G 抖動的一個真實成因(CMIS 問題)。

線性驅動可插拔光模組(LPO)取消了模組內的 DSP 以降低功耗和延遲,將均衡功能移到交換機 ASIC 上;在主機支援的短距 DR 鏈路上已開始出現。

大規模下的可靠性

數量一旦上去,算法就完全變了:擁有 100 000 個光模組時,即便年故障率只有 0.5%,每週也要更換十個。由此帶來的後果:

  • 在整個機群範圍內按通道監測 DDM 並跟蹤趨勢,在劣化模組拖慢訓練某一步之前將其更換(故障)。
  • 按批次準備備件並做進料檢驗——故障往往按生產批次聚集出現。
  • MPO 清潔紀律——每個連接器 16 根光纖,一粒塵埃就能使一個通道失效(鏈路抖動)。
  • 一個慢通道會拖慢整個集合操作:尾延遲才是關鍵指標

身份資訊與互操作性

大型集群通常只使用一份很短的已驗證模組清單,交換機平台會校驗身份資訊。在平台允許的場合使用第三方 400G/800G 光模組,在不允許的場合則按預期身份編碼——與其他場景相同的廠商鎖定 規則在這裏同樣適用,只是單價高得多。

未來走向

1.6T 端口(OSFP-XD,16 通道)和每通道 200G 電介面是下一步;對於最大規模的系統,共封裝光學會把光模組直接移入交換機封裝內部。

在 CodingBox 中

CodingBox 通過 CMIS 讀取 400G/800G OSFP 和 QSFP-DD 模組:模組狀態、應用能力聲明、身份資訊,以及在 DDM 介面顯示的每通道發射/接收光功率和偏置電流——這些正是營運方驗證進貨批次、建立新鏈路基線、以及在八個通道中定位單個故障通道所需的數據。

把這些選擇轉化為線纜數量、傳輸距離和安裝檢查清單:AI 集群佈線;安裝完成後維持鏈路正常運行:鏈路可靠性與監測

1.6T 模組本身——通道、功耗、分組、兼容性:OSFP224OSFP-XD


如果您發現本文有不準確之處或錯誤,請選取相應片段並按 Ctrl+Enter,即可