CodingBox ドキュメント

NIC のポート、速度と PCIe 帯域幅

NIC のフロントパネルは「2 × 100G」を謳いますが、サーバーが実際に 200 Gb/s を動かせるかどうかは、カードの背後にある PCIe スロット次第です。特定のモジュールが動作するかどうかは、ケージとコントローラーのレーンマップ次第で、これはスイッチとまったく同じ話ですが、ポート数が少なく、バスを過小に見積もりやすい点が異なります。このページでは、NIC に見られるケージと速度、デュアルレートポートとブレークアウトケーブルの規則、PCIe の計算、OCP 3.0 のフォームファクター、そしてカード上の光学部品にとって重要な電力と冷却の限界を扱います。

NIC のケージと速度

ケージNIC で見られる速度代表的なコントローラー備考
SFP+10G(一部は 1G も)Intel X520/X710、Broadcom 5741x1G 対応は機種によって異なる;カードの仕様を確認
SFP2825G、10G(1G はまれ)Intel XXV710/E810-XXV、ConnectX-4 Lx/-6 Lx、Broadcom P22525G には FEC の一致が必要(FEC と AN
SFP5650G、25G、10GConnectX-6 Lx/Dx(一部)PAM4 レーン
QSFP28100G、4 × 25G、2 × 50G、40G、4 × 10GIntel E810-CQDA2、ConnectX-5/6、Broadcom P2100ブレークアウトはコントローラーが許可する場合のみケーブル経由で可能
QSFP56200G、100G、2 × 100GConnectX-6 Dx/-7、Broadcom P2200、Pensando
QSFP112400G、200G、100G、4 × 100GConnectX-7、Broadcom P1400GDレーンあたり 100G;QSFP28/56 も受け入れる
QSFP-DD400G、2 × 200G、4 × 100GBroadcom BCM57608
OSFP(ツインポート)2 × 400G、800GConnectX-7/-8、BlueField-3Nvidia のツインポート設計では1ケージに論理ポート2つ
RJ451G / 10GBASE-T / mGigX550、X710-T、BCM57416モジュールなし、カード上に PHY

ケージの互換性規則はスイッチと同じです(ポート種別とケージ)。

デュアルレートポートと速度グループ

  • 大半の 25G NIC は各ポートを 10G または 25G で独立に動作させます(4ポート単位のグループ化はありません)。ただし一部のデュアルポートコントローラーは SerDes グループを共有し、両ポートに同じ速度を強制します。
  • 100G カードは 40G モジュールに対応していることが多く、200G/400G カードは 100G モジュールに対応します。2世代以上下のモジュール(SFP28 での 1G、QSA 経由で QSFP56 での 10G)への対応はまれです。
  • 速度は通常、モジュールのコンプライアンスコードから自動で決まります。モジュールがデュアルレートであるか認識されない場合は、固定設定(ethtool -s … speed)が必要です(ツール)。

NIC におけるブレークアウト

ケース可能か
100G QSFP28 の NIC ポート → スイッチへ 4 × 25G(DAC スプリッター)コントローラーが「4 × 25G port split」モードに対応している場合のみ可能(多くの Nvidia・Broadcom カードは対応、大半の Intel は非対応);この場合カードは4つの netdev を表示する
スイッチの 100G ポート → 4台の NIC の SFP28 ポートへ 4 × 25G可能。これが一般的な方向で、分割はスイッチ側で設定します(ブレークアウトと MPO
400G OSFP ツインポート → 2 × 400G または 4 × 200G / 8 × 100GNvidia のツインポートカードは1ケージに論理ポート2つ;それ以上の分割はファームウェア次第
QSFP28 ポートからの 2 × 50G一部のコントローラーで可能

PCIe:実効ポート速度

PCIe 世代レーンあたり(規格値)x8 実効(≈)x16 実効(≈)
Gen 38 GT/s56–63 Gb/s112–126 Gb/s
Gen 416 GT/s112–126 Gb/s225–252 Gb/s
Gen 532 GT/s225–252 Gb/s450–504 Gb/s
Gen 664 GT/s~450–500 Gb/s~900–1 000 Gb/s

実効スループットは、符号化とパケットオーバーヘッドを差し引くと規格値の 85–90 % になります。ポートとレーン数を対応させると次のとおりです。

カードポート必要な PCIe
2 × 25G50 Gb/sGen 3 x8
2 × 100G200 Gb/sGen 4 x16(Gen 3 x16 は ~126 で頭打ち)
1 × 200G / 2 × 100G Gen 4200 Gb/sGen 4 x16
2 × 200G400 Gb/sGen 5 x16
1 × 400G400 Gb/sGen 5 x16(または「socket direct」/マルチホストで x16 を2本)
2 × 400G800 Gb/sGen 6 x16、または Gen 5 x16 を2本

2 × 100G のカードを Gen 3 x8 スロットに挿すと、両ポートとも 100G でリンクしますが、合計のスループットは 60 Gb/s 程度にとどまります。光学部品は問題なく、バスの方が足りていません。ネゴシエートされたリンク幅と速度(LnkSta)は lspci -vv で確認し、BIOS のバイファーケーション設定も確認してください。

OCP NIC 3.0

項目SFF(小型フォームファクター)LFF(大型)
サイズ76 × 115 mm139 × 115 mm
PCIe最大 x16最大 x32(x16 を2本)
電力最大 80 W最大 150 W
ポート2–4 × SFP28/QSFP28/QSFP56/QSFP1122 × QSFP-DD/OSFP 以上
光学部品へのアクセスモジュール前面から、工具不要同左

OCP カードはサーバー背面に配置され、専用の気流経路を持ちます。GPU の間に埋め込まれた PCIe カードに比べ、モジュールの冷却は通常良好です。

カード上の光学部品における電力と冷却

項目上限/規則
PCIe スロットの電力25 W(x1…x8 ロープロファイル)、75 W(x16);400G カードは8ピンの補助コネクターを使用
NIC のケージあたりの予算SFP28:1.5 W(レベル II);QSFP28:3.5–4.5 W;QSFP56/112:5–8 W;QSFP-DD/OSFP:12–20 W。カードのデータシートに記載があります(電力と消費
気流カード全体で 200–300 LFM;1U サーバーで CPU の排気に近いカード上の光学部品は高温になりやすく、DDM 温度が 60 °C を超えることも珍しくありません
サーマルスロットリングモジュールが高温を報告すると、コントローラーによってはモジュールを低電力にするかポートを閉じるものがある
NIC 上のコヒーレント/ZR標準的な NIC では非対応。クラス8はケージの電力予算を超える

マルチホストと socket direct

ハイエンドカードは、2つの CPU ソケット(x8 または x16 のリンクを2本)や複数のホストに対して、自らを提示できます。光学側は変わらず、分割は PCIe 側で行われます。Gen 4 プラットフォームでの 400G や、各 GPU の NIC がそれぞれ専用の PCIe ルートに置かれる必要がある GPU サーバーで関係してきます。

光学部品の観点で NIC を選ぶ際のチェックリスト

  1. ケージの種類と、そのケージでコントローラーが対応する速度。
  2. 対象スロットの PCIe 世代とレーン数、それに対するポート合計帯域幅。
  3. ブレークアウトは必要か。コントローラーがポート分割に対応している必要があります。
  4. ドライバーのモジュールポリシー(NIC における光学部品の互換性)。
  5. ケージの電力予算と、導入予定のモジュール;補助電源コネクターの有無。
  6. シャーシ内の設置位置における気流。冷却を重視するなら OCP 3.0 も検討してください。
  7. FEC モードと速度固定に対する OS/ドライバーの対応。

CodingBox では

モジュールのコンプライアンスコードとパワークラスを見れば、そのモジュールが NIC のケージと速度に対応できるかが分かります。CodingBox はモジュールを取り付ける前にこれらを読み取り、ポート分割や PCIe に関する判断はサーバー側で行います(Check transceiver)。


この記事に不正確な点や誤りを見つけた場合は、該当する箇所を選択して Ctrl+Enter を押すと、できます。