NIC のポート、速度と PCIe 帯域幅
NIC のフロントパネルは「2 × 100G」を謳いますが、サーバーが実際に 200 Gb/s を動かせるかどうかは、カードの背後にある PCIe スロット次第です。特定のモジュールが動作するかどうかは、ケージとコントローラーのレーンマップ次第で、これはスイッチとまったく同じ話ですが、ポート数が少なく、バスを過小に見積もりやすい点が異なります。このページでは、NIC に見られるケージと速度、デュアルレートポートとブレークアウトケーブルの規則、PCIe の計算、OCP 3.0 のフォームファクター、そしてカード上の光学部品にとって重要な電力と冷却の限界を扱います。
NIC のケージと速度
| ケージ | NIC で見られる速度 | 代表的なコントローラー | 備考 |
|---|---|---|---|
| SFP+ | 10G(一部は 1G も) | Intel X520/X710、Broadcom 5741x | 1G 対応は機種によって異なる;カードの仕様を確認 |
| SFP28 | 25G、10G(1G はまれ) | Intel XXV710/E810-XXV、ConnectX-4 Lx/-6 Lx、Broadcom P225 | 25G には FEC の一致が必要(FEC と AN) |
| SFP56 | 50G、25G、10G | ConnectX-6 Lx/Dx(一部) | PAM4 レーン |
| QSFP28 | 100G、4 × 25G、2 × 50G、40G、4 × 10G | Intel E810-CQDA2、ConnectX-5/6、Broadcom P2100 | ブレークアウトはコントローラーが許可する場合のみケーブル経由で可能 |
| QSFP56 | 200G、100G、2 × 100G | ConnectX-6 Dx/-7、Broadcom P2200、Pensando | — |
| QSFP112 | 400G、200G、100G、4 × 100G | ConnectX-7、Broadcom P1400GD | レーンあたり 100G;QSFP28/56 も受け入れる |
| QSFP-DD | 400G、2 × 200G、4 × 100G | Broadcom BCM57608 | — |
| OSFP(ツインポート) | 2 × 400G、800G | ConnectX-7/-8、BlueField-3 | Nvidia のツインポート設計では1ケージに論理ポート2つ |
| RJ45 | 1G / 10GBASE-T / mGig | X550、X710-T、BCM57416 | モジュールなし、カード上に PHY |
ケージの互換性規則はスイッチと同じです(ポート種別とケージ)。
デュアルレートポートと速度グループ
- 大半の 25G NIC は各ポートを 10G または 25G で独立に動作させます(4ポート単位のグループ化はありません)。ただし一部のデュアルポートコントローラーは SerDes グループを共有し、両ポートに同じ速度を強制します。
- 100G カードは 40G モジュールに対応していることが多く、200G/400G カードは 100G モジュールに対応します。2世代以上下のモジュール(SFP28 での 1G、QSA 経由で QSFP56 での 10G)への対応はまれです。
- 速度は通常、モジュールのコンプライアンスコードから自動で決まります。モジュールがデュアルレートであるか認識されない場合は、固定設定(
ethtool -s … speed)が必要です(ツール)。
NIC におけるブレークアウト
| ケース | 可能か |
|---|---|
| 100G QSFP28 の NIC ポート → スイッチへ 4 × 25G(DAC スプリッター) | コントローラーが「4 × 25G port split」モードに対応している場合のみ可能(多くの Nvidia・Broadcom カードは対応、大半の Intel は非対応);この場合カードは4つの netdev を表示する |
| スイッチの 100G ポート → 4台の NIC の SFP28 ポートへ 4 × 25G | 可能。これが一般的な方向で、分割はスイッチ側で設定します(ブレークアウトと MPO) |
| 400G OSFP ツインポート → 2 × 400G または 4 × 200G / 8 × 100G | Nvidia のツインポートカードは1ケージに論理ポート2つ;それ以上の分割はファームウェア次第 |
| QSFP28 ポートからの 2 × 50G | 一部のコントローラーで可能 |
PCIe:実効ポート速度
| PCIe 世代 | レーンあたり(規格値) | x8 実効(≈) | x16 実効(≈) |
|---|---|---|---|
| Gen 3 | 8 GT/s | 56–63 Gb/s | 112–126 Gb/s |
| Gen 4 | 16 GT/s | 112–126 Gb/s | 225–252 Gb/s |
| Gen 5 | 32 GT/s | 225–252 Gb/s | 450–504 Gb/s |
| Gen 6 | 64 GT/s | ~450–500 Gb/s | ~900–1 000 Gb/s |
実効スループットは、符号化とパケットオーバーヘッドを差し引くと規格値の 85–90 % になります。ポートとレーン数を対応させると次のとおりです。
| カード | ポート | 必要な PCIe |
|---|---|---|
| 2 × 25G | 50 Gb/s | Gen 3 x8 |
| 2 × 100G | 200 Gb/s | Gen 4 x16(Gen 3 x16 は ~126 で頭打ち) |
| 1 × 200G / 2 × 100G Gen 4 | 200 Gb/s | Gen 4 x16 |
| 2 × 200G | 400 Gb/s | Gen 5 x16 |
| 1 × 400G | 400 Gb/s | Gen 5 x16(または「socket direct」/マルチホストで x16 を2本) |
| 2 × 400G | 800 Gb/s | Gen 6 x16、または Gen 5 x16 を2本 |
2 × 100G のカードを Gen 3 x8 スロットに挿すと、両ポートとも 100G でリンクしますが、合計のスループットは 60 Gb/s 程度にとどまります。光学部品は問題なく、バスの方が足りていません。ネゴシエートされたリンク幅と速度(LnkSta)は lspci -vv で確認し、BIOS のバイファーケーション設定も確認してください。
OCP NIC 3.0
| 項目 | SFF(小型フォームファクター) | LFF(大型) |
|---|---|---|
| サイズ | 76 × 115 mm | 139 × 115 mm |
| PCIe | 最大 x16 | 最大 x32(x16 を2本) |
| 電力 | 最大 80 W | 最大 150 W |
| ポート | 2–4 × SFP28/QSFP28/QSFP56/QSFP112 | 2 × QSFP-DD/OSFP 以上 |
| 光学部品へのアクセス | モジュール前面から、工具不要 | 同左 |
OCP カードはサーバー背面に配置され、専用の気流経路を持ちます。GPU の間に埋め込まれた PCIe カードに比べ、モジュールの冷却は通常良好です。
カード上の光学部品における電力と冷却
| 項目 | 上限/規則 |
|---|---|
| PCIe スロットの電力 | 25 W(x1…x8 ロープロファイル)、75 W(x16);400G カードは8ピンの補助コネクターを使用 |
| NIC のケージあたりの予算 | SFP28:1.5 W(レベル II);QSFP28:3.5–4.5 W;QSFP56/112:5–8 W;QSFP-DD/OSFP:12–20 W。カードのデータシートに記載があります(電力と消費) |
| 気流 | カード全体で 200–300 LFM;1U サーバーで CPU の排気に近いカード上の光学部品は高温になりやすく、DDM 温度が 60 °C を超えることも珍しくありません |
| サーマルスロットリング | モジュールが高温を報告すると、コントローラーによってはモジュールを低電力にするかポートを閉じるものがある |
| NIC 上のコヒーレント/ZR | 標準的な NIC では非対応。クラス8はケージの電力予算を超える |
マルチホストと socket direct
ハイエンドカードは、2つの CPU ソケット(x8 または x16 のリンクを2本)や複数のホストに対して、自らを提示できます。光学側は変わらず、分割は PCIe 側で行われます。Gen 4 プラットフォームでの 400G や、各 GPU の NIC がそれぞれ専用の PCIe ルートに置かれる必要がある GPU サーバーで関係してきます。
光学部品の観点で NIC を選ぶ際のチェックリスト
- ケージの種類と、そのケージでコントローラーが対応する速度。
- 対象スロットの PCIe 世代とレーン数、それに対するポート合計帯域幅。
- ブレークアウトは必要か。コントローラーがポート分割に対応している必要があります。
- ドライバーのモジュールポリシー(NIC における光学部品の互換性)。
- ケージの電力予算と、導入予定のモジュール;補助電源コネクターの有無。
- シャーシ内の設置位置における気流。冷却を重視するなら OCP 3.0 も検討してください。
- FEC モードと速度固定に対する OS/ドライバーの対応。
CodingBox では
モジュールのコンプライアンスコードとパワークラスを見れば、そのモジュールが NIC のケージと速度に対応できるかが分かります。CodingBox はモジュールを取り付ける前にこれらを読み取り、ポート分割や PCIe に関する判断はサーバー側で行います(Check transceiver)。