CodingBox 說明文件

InfiniBand 組網基礎

InfiniBand 網絡與以太網絡在診斷鏈路時相關的一些方面表現不同。本頁介紹光模組工程師會遇到的概念:子網管理器、無損流量控制、拓撲結構,以及故障鏈路的表現形式。

子網管理器

每個 IB 子網都有一個活動的子網管理器(SM)。它發現所有端口和交換機,分配本地識別碼(LID),計算轉發表並將其編程到每台交換機中。鏈路發生抖動時,SM 會重新掃描整個網絡——因此一個臨界光模組造成的不只是一條鏈路失效,還會觸發所有人都能察覺的全網範圍重新路由事件。

基於信用的無損傳輸

IB 鏈路在正常運行中不會丟包:發送方只有在接收方聲明了緩衝信用時才會發送。因此擁塞表現為反壓而不是丟棄,一條劣化的鏈路(符號錯誤上升、FEC 糾錯增多)會拖慢依賴它的整個作業——這就是集合操作中的「單條慢鏈路」問題。

拓撲結構

  • 胖樹(Clos)——標準方案:葉層交換機連接主機,脊層交換機連接葉層交換機,上行鏈路數量足以實現無阻塞。大多數鏈路是葉層–脊層光模組。
  • Dragonfly+ 及環形(torus)變體出現在最大規模的系統中,用於節省交換機和電纜。
  • 面向 AI 的軌道優化(rail-optimised)設計將每個 GPU 的網卡放在網絡的一個獨立「軌道」上,使跨伺服器具有相同編號的 GPU 之間只相隔一跳——參見 GPU 網絡拓撲

RDMA 與 GPUDirect

應用程式使用 RDMA verb 在節點記憶體之間搬運數據,無需 CPU 參與拷貝; GPUDirect RDMA 將這一能力擴展到 GPU 記憶體。其結果是,網絡故障對應用程式表現為集合操作中的停滯或超時,這通常遠早於運維人員發現端口宕掉。

故障鏈路的表現

網絡中的症狀需檢查的物理層原因
某端口上符號錯誤上升/FEC 糾正塊增多MPO 髒污、接收光功率臨界、通道劣化
鏈路卡在較低的寬度或速率FEC 不匹配、模組未聲明預期速率
端口顯示「Not supported」,無鏈路模組身份無法識別——廠商鎖定
反覆的 SM 掃描某處存在抖動鏈路——通過逐端口錯誤計數器定位

按常規的診斷步驟排查:電平 → 清潔 → 更換 → 電纜。

在 CodingBox 中

在工作台上讀取可疑的 IB 模組:DDM 介面上的逐通道 Rx/Tx 和偏置電流顯示 SR4/DR4 模組是否有某條通道正在失效,身份欄位則顯示網絡是否會接受替換模組。

協議層、隊列對和子網管理器功能詳情:IB 協議與傳輸;按代際和傳輸距離進行網絡佈線:IB 佈線


如果您發現本文有不準確之處或錯誤,請選取相應片段並按 Ctrl+Enter,即可