CodingBox ドキュメント

SmartNIC と DPU:プログラマブルアダプター上の光モジュール

データプロセシングユニット(DPU)や SmartNIC は、独自のプロセッサー、メモリー、OS を備えた NIC で、サーバーの PCIe バスとネットワークの間に位置します。光学部品にとってケージ側は何も変わりません。同じ QSFP56/QSFP112/OSFP のモジュールとケーブルです。ただし、モジュールを読み取り、ポリシーを適用し、速度と FEC を設定する主体は、いまやカード上の小さなコンピューターであり、多くの場合 Linux や SONiC 系のスタックを動かしています。このページでは、現行の DPU ファミリーとそのポート、モジュール管理がどこにあるかを説明し、光学部品に固有の帰結、すなわち電力、冷却、ツインポートケージ、AI バックエンドファブリックを扱います。

ファミリーとポート

ファミリー世代ポートケージホスト PCIeコア
Nvidia BlueField-220202 × 25/100G または 1 × 200GSFP56 / QSFP56Gen 4 x168 × Arm A72
Nvidia BlueField-320232 × 200G または 1 × 400G;SuperNIC 版は 400GQSFP112 / OSFPGen 5 x1616 × Arm A78
Nvidia ConnectX-8 SuperNIC2024–251 × 800G または 2 × 400GOSFP(ツインポート)/ QSFP112Gen 6 x16(NIC + 限定的なプログラマビリティ)
AMD Pensando Elba / Giglio / Salina(400)2021–252 × 100/200G;2 × 400GQSFP56 / QSFP112Gen 4/5 x1616 × Arm A72/N1 + P4 パイプライン
Intel IPU E2000(Mount Evans)20222 × 100G(合計 200G)QSFP28/56Gen 4 x1616 × Arm N1 + P4
Marvell Octeon 10 DPU2022合計最大 400GQSFP-DDGen 5Arm N2
Microsoft/Fungible、Napatech、Xilinx Alveo SN1000様々2 × 100GQSFP28FPGA / MIPS

ポートのケージと速度は、通常の NIC と同じ規則に従います(NIC ポートと PCIe)。

モジュール管理の所在

モードモジュールを読むのは誰かツール
組み込み/DPU モード(Arm 側がポートを所有)DPU 自身の OS(Ubuntu/DOCA、SONiC-DASH、ベンダー Linux)がそのドライバー経由でArm 側で ethtool -mmlxlink;ホストからは仮想関数のみ見える
ホスト/NIC 分離モードConnectX と同様にホストのドライバーがホスト側の ethtoolmlxlinkNIC ツール
制限モードDPU が制御し、ホストはリンク設定を変更できないポリシーは DPU 上で強制される

帰結として、ファームウェアとリンク設定(速度、FEC、ブレークアウト)は DPU 上で設定され(mlxconfig、DOCA ツール、Pensando の penctl)、ホストの再起動を超えて保持されます。DPU によって拒否またはダウングレードされたモジュールは、DPU のログを読むまでホスト管理者には見えません。モジュールポリシー自体は、Nvidia と AMD では NIC の場合と同様に寛容です(どんな EEPROM でもパースします)(NIC における光学部品の互換性)。

電力と冷却

項目DPU での実情
カードの電力75–150 W(BlueField-3 は補助コネクター使用時で約 150 W)。カード自体が、搭載するどのモジュールよりも発熱します
ケージの予算QSFP112/OSFP ケージは 15–20 W のモジュールを想定;カードの仕様を確認
気流GPU サーバーのフルハイトカードは GPU とホットアイルを共有;モジュールの DDM 温度は 60–70 °C が正常範囲で、75 以上でアラーム(温度グレード
ツインポート OSFP1つの OSFP ケージが 2 × 400G を運ぶ;モジュール(またはツインポート DAC/AOC)は、独自のヒートシンクを持つ単一の 800G クラスデバイス(OSFP
光学部品の選択ToR が 2 m 以内なら DAC、そうでなければ AOC または 400G/800G DR/FR;LPO 版は短距離リンクでモジュールの消費電力を削減する(電力と消費

AI バックエンドファブリック

GPU クラスターでは、GPU ごとの DPU または SuperNIC が、レール最適化されたバックエンドファブリック、すなわち InfiniBand または RoCE イーサネットに接続します(GPU ファブリック)。

リンク代表的な光学部品
GPU ごとの NDR 400G IBツインポート OSFP 2 × 400G;レールリーフまで DAC/ACC ≤ 3 m、AOC 3–50 m、それ以上は DR4/SR4 光学部品(IB ケーブル
GPU ごとの XDR 800G IB/800G イーサネットOSFP 800G ツインポート、2 × DR4 または SR8
フロントエンド/ストレージDPU 上の別系統の 100/200G ポート、または2枚目の NIC

ケーブルの識別情報と長さはファブリックマネージャーが検証します。モジュールのファームウェアバージョンは、クラスターの認定部品表(BOM)の一部です(AI クラスターの配線リンクの信頼性と監視)。

カード上の SONiC と P4

SONiC-DASH や P4 パイプラインを動かす DPU は、自らのポートを小型のスイッチのように扱います。ポートのブレークアウト、FEC、速度は DPU の設定データベースで設定され、トランシーバーの EEPROM は、SONiC スイッチと同じ show interfaces transceiver コマンド群の下に表示されます(NOS の全体像)。サードパーティ製モジュールに対する挙動は、プラットフォームプラグインの挙動そのもの、つまり寛容です。

CodingBox では

DPU 向けのモジュールも、スイッチや NIC 向けと同じように適合性を確認します。フォームファクターと準拠性(QSFP112/OSFP、CMIS における 400G/800G アプリケーション)、ケージに対するパワークラス、クラスターの BOM 向けファームウェアバージョンです。これらはすべて、カードを取り付ける前にベンチで読み取れます(Check transceiverCMIS)。


この記事に不正確な点や誤りを見つけた場合は、該当する箇所を選択して Ctrl+Enter を押すと、できます。