SmartNIC 與 DPU:可編程網卡上的光模組
數據處理單元(DPU)或 SmartNIC 是一種帶有自己的處理器、記憶體和作業系統的網卡,位於伺服器 PCIe 總線和網絡之間。對光模組而言,籠子這一端甚麼都沒變—— 仍是同樣的 QSFP56/QSFP112/OSFP 模組和線纜——但讀取模組、執行策略、配置速率和 FEC 的主體,如今是卡上的一台小型電腦,通常運行 Linux 或類 SONiC 的系統。本文列出目前的 DPU 系列及其端口,說明模組管理落在哪裏,並介紹光模組相關的後果:功耗、散熱、雙端口籠子和 AI 後端 fabric。
系列與端口
| 系列 | 代 | 端口 | 籠子 | 主機 PCIe | 核心 |
|---|---|---|---|---|---|
| Nvidia BlueField-2 | 2020 | 2 × 25/100G 或 1 × 200G | SFP56 / QSFP56 | Gen 4 x16 | 8 × Arm A72 |
| Nvidia BlueField-3 | 2023 | 2 × 200G 或 1 × 400G;SuperNIC 變體 400G | QSFP112 / OSFP | Gen 5 x16 | 16 × Arm A78 |
| Nvidia ConnectX-8 SuperNIC | 2024–25 | 1 × 800G 或 2 × 400G | OSFP(雙端口)/ QSFP112 | Gen 6 x16 | (NIC,可編程性有限) |
| AMD Pensando Elba / Giglio / Salina(400) | 2021–25 | 2 × 100/200G;2 × 400G | QSFP56 / QSFP112 | Gen 4/5 x16 | 16 × Arm A72/N1 + P4 管線 |
| Intel IPU E2000(Mount Evans) | 2022 | 2 × 100G(合計 200G) | QSFP28/56 | Gen 4 x16 | 16 × Arm N1 + P4 |
| Marvell Octeon 10 DPU | 2022 | 最高聚合 400G | QSFP-DD | Gen 5 | Arm N2 |
| Microsoft/Fungible、Napatech、Xilinx Alveo SN1000 | 各不相同 | 2 × 100G | QSFP28 | — | FPGA / MIPS |
端口籠子和速率遵循與普通網卡相同的規則(網卡端口與 PCIe)。
模組管理落在哪裏
| 模式 | 誰讀取模組 | 工具 |
|---|---|---|
| 嵌入式 / DPU 模式(端口由 Arm 側掌控) | DPU 自身的作業系統(Ubuntu/DOCA、SONiC-DASH、廠商 Linux)通過其驅動讀取 | Arm 側的 ethtool -m、mlxlink;主機只能看到虛擬功能(VF) |
| 主機/網卡分離模式 | 主機驅動,與 ConnectX 上相同 | 主機側 ethtool、mlxlink(網卡工具) |
| 受限模式 | 由 DPU 控制,主機無法更改鏈路設定 | 策略在 DPU 上執行 |
由此帶來的後果:固件和鏈路設定(速率、FEC、拆分)在 DPU 上配置(mlxconfig、 DOCA 工具、Pensando penctl),並在主機重啟後依然保留;被 DPU 拒絕或降級的模組,主機管理員在查看 DPU 日誌之前根本看不到。模組策略本身在 Nvidia 和 AMD 上是寬鬆的(解析任意 EEPROM),與它們的網卡一致(網卡上的光模組兼容性)。
功耗與散熱
| 項目 | DPU 實際情況 |
|---|---|
| 板卡功耗 | 75–150 W(BlueField-3 帶輔助電源介面時約 150 W)——板卡本身比卡上任何模組都更熱 |
| 籠子預算 | QSFP112/OSFP 籠子按 15–20 W 的模組設計;請查閱板卡規格書 |
| 氣流 | GPU 伺服器中的全高卡與 GPU 共享熱通道;模組 DDM 溫度 60–70 °C 屬正常,75 °C 以上會警報(溫度等級) |
| 雙端口 OSFP | 一個 OSFP 籠子承載 2 × 400G;該模組(或雙端口 DAC/AOC)是帶有自己散熱片的單個 800G 級器件(OSFP) |
| 光模組選擇 | ToR 在 2 m 以內時用 DAC,否則用 AOC 或 400G/800G DR/FR;LPO 變體在短鏈路上能降低模組功耗(功耗) |
AI 後端 fabric
在 GPU 集群中,每個 GPU 配一塊 DPU 或 SuperNIC,連接到經過 rail 優化的後端 fabric,即 InfiniBand 或 RoCE 以太網(GPU 組網):
| 鏈路 | 常見光模組 |
|---|---|
| 每 GPU 一條 NDR 400G IB | 雙端口 OSFP 2 × 400G;到 rail leaf 距離 ≤ 3 m 用 DAC/ACC,3–50 m 用 AOC,更遠用 DR4/SR4 光模組(IB 線纜) |
| 每 GPU 一條 XDR 800G IB / 800G 以太網 | OSFP 800G 雙端口,2 × DR4 或 SR8 |
| 前端 / 儲存 | DPU 上獨立的 100/200G 端口,或第二塊網卡 |
線纜身份和長度由 fabric manager 校驗;模組固件版本也是集群認證物料清單的一部分(AI 集群佈線、 鏈路可靠性與監測)。
卡上的 SONiC 與 P4
運行 SONiC-DASH 或 P4 管線的 DPU,把自己的端口當成一台小型交換機來對待:端口拆分、FEC 和速率在 DPU 的配置資料庫中設定,光模組 EEPROM 也出現在與 SONiC 交換機相同的 show interfaces transceiver 命令下(NOS 全景)。對第三方模組的行為由平台插件決定——是寬鬆的。
在 CodingBox 中
面向 DPU 的模組,認證方式與面向交換機或網卡的模組相同:封裝形式和合規性(QSFP112/OSFP,CMIS 中的 400G/800G 應用)、相對籠子的功率等級,以及用於集群 BOM 的固件版本——這些都可以在安裝前於工作台上讀出(Check transceiver、CMIS)。