AI 互連與光模組
AI 集群使用 InfiniBand 或高速以太網連接 GPU。兩者都把光模組推向了量產中速度最快的型號。
InfiniBand 與以太網(RoCE)
| InfiniBand | 以太網 + RoCE | |
|---|---|---|
| 流控 | 基於信用、無損 | PFC/ECN,無損 |
| RDMA | 原生支援 | RoCEv2 |
| 當前速率 | NDR(400G) | 400G / 800G |
| 生態 | 源自 HPC | 廣泛,多廠商 |
兩者都是可行的選擇;許多大型集群使用 InfiniBand,而以太網+RoCE 在大規模 AI 場景中增長很快。
速率與模組
- 400G——QSFP-DD 或 OSFP,由 4×100G 或 8×50G 通道構成。
- 800G——OSFP 或 QSFP-DD800,通常為 8×100G 通道。
速率和通道數決定了封裝形式; InfiniBand 各代及其每通道速率見 InfiniBand 速率。
傳輸距離類型
機櫃內以短距 DR/SR 光模組或直連線纜、有源線纜為主;行與行之間, FR/LR 單模光模組承擔更長的跳段。高密度意味著單台交換機可容納數百個這樣的模組。
無論傳輸距離如何,這些模組都攜帶標準的受管記憶體——CodingBox 在鏈路加入組網之前讀取其身份資訊和 DDM 以進行驗證。