InfiniBand 組網基礎
InfiniBand 網絡與以太網絡在診斷鏈路時相關的一些方面表現不同。本頁介紹光模組工程師會遇到的概念:子網管理器、無損流量控制、拓撲結構,以及故障鏈路的表現形式。
子網管理器
每個 IB 子網都有一個活動的子網管理器(SM)。它發現所有端口和交換機,分配本地識別碼(LID),計算轉發表並將其編程到每台交換機中。鏈路發生抖動時,SM 會重新掃描整個網絡——因此一個臨界光模組造成的不只是一條鏈路失效,還會觸發所有人都能察覺的全網範圍重新路由事件。
基於信用的無損傳輸
IB 鏈路在正常運行中不會丟包:發送方只有在接收方聲明了緩衝信用時才會發送。因此擁塞表現為反壓而不是丟棄,一條劣化的鏈路(符號錯誤上升、FEC 糾錯增多)會拖慢依賴它的整個作業——這就是集合操作中的「單條慢鏈路」問題。
拓撲結構
- 胖樹(Clos)——標準方案:葉層交換機連接主機,脊層交換機連接葉層交換機,上行鏈路數量足以實現無阻塞。大多數鏈路是葉層–脊層光模組。
- Dragonfly+ 及環形(torus)變體出現在最大規模的系統中,用於節省交換機和電纜。
- 面向 AI 的軌道優化(rail-optimised)設計將每個 GPU 的網卡放在網絡的一個獨立「軌道」上,使跨伺服器具有相同編號的 GPU 之間只相隔一跳——參見 GPU 網絡拓撲。
RDMA 與 GPUDirect
應用程式使用 RDMA verb 在節點記憶體之間搬運數據,無需 CPU 參與拷貝; GPUDirect RDMA 將這一能力擴展到 GPU 記憶體。其結果是,網絡故障對應用程式表現為集合操作中的停滯或超時,這通常遠早於運維人員發現端口宕掉。
故障鏈路的表現
| 網絡中的症狀 | 需檢查的物理層原因 |
|---|---|
| 某端口上符號錯誤上升/FEC 糾正塊增多 | MPO 髒污、接收光功率臨界、通道劣化 |
| 鏈路卡在較低的寬度或速率 | FEC 不匹配、模組未聲明預期速率 |
| 端口顯示「Not supported」,無鏈路 | 模組身份無法識別——廠商鎖定 |
| 反覆的 SM 掃描 | 某處存在抖動鏈路——通過逐端口錯誤計數器定位 |
按常規的診斷步驟排查:電平 → 清潔 → 更換 → 電纜。
在 CodingBox 中
在工作台上讀取可疑的 IB 模組:DDM 介面上的逐通道 Rx/Tx 和偏置電流顯示 SR4/DR4 模組是否有某條通道正在失效,身份欄位則顯示網絡是否會接受替換模組。