CodingBox ドキュメント

AI クラスターのケーブリング:本数、距離、メディア、品質確認

GPU クラスターの大部分はケーブルでできています。1ノードに8基の GPU があれば、8本の 400G(または 800G)スケールアウトリンクに加えて管理系とストレージ系の配線が必要になります。GPU が1 000基あれば、2〜3段のスイッチ層にまたがる数千の光学端点があり、そのどれもが学習を止めかねません。このページでは、GPU ファブリックで示したファブリック設計を、ケーブル本数、伝送距離クラス、コネクターの選択、設置チェックリストに落とし込みます。

リンク数の算出

1 GPU あたり 400G NIC を1枚搭載した、典型的な8-GPU ノードでのレール最適化2段ファブリックの場合。

項目計算式1 024 GPU(128ノード)
GPU–リーフ間リンクGPU × 11 024 × 400G
リーフ–スパイン間リンク(ノンブロッキング)= GPU–リーフ1 024 × 400G
光/ケーブルの端点(1リンクにつき2)リンク × 24 096
ストレージ+管理用 NIC1ノードあたり2–4さらに256–512リンク
予備の光学部品(3–5 %)150–250

NDR のツインポートスイッチモジュール(OSFP 1台あたり 2 × 400G)を使うと、スイッチ側のモジュール数は半分になりますが、光ファイバー数は半分になりません。3段構成では、GPU 1 024基につきさらに1 024本のスパイン–コア間リンクが追加されます。これらの端点のひとつひとつが、識別情報と DDM を持つトランシーバーまたはケーブルプラグです(リンクの信頼性と監視)。

レール最適化レイアウトにおける距離

セグメント一般的な距離メディア
GPU NIC → リーフ、同一ラック内≤ 2 mパッシブ DAC(400G ≤ 2 m;800G ≤ 1–1.5 m)— 最も安価、消費電力ゼロ、重い
GPU NIC → リーフ、隣接ラック(レールグループは1列に広がる)3–10 mAEC(≤ 3–5 m)または MMF 上の AOC/SR トランシーバー
リーフ → スパイン、同一ホール内10–100 mAOC は ~50–100 m まで;OM4 上の SR4/SR8 / VR は ≤ 50–100 m;SMF 上の DR4/DR8 は 500 m — 400G 以上では DR が主流になりつつある
スパイン → コア/ホール間100 m – 2 kmシングルモードの DR4 / FR4 / 2×FR4
建物間 DCI2–80 kmLR4、ZR/ZR+(コヒーレントと長距離伝送

レール最適化配線では、各ノードの GPU i をリーフ i に接続するため、1ノードの8本のケーブルは8台の異なるリーフへ分岐します。ほとんどの GPU–リーフ間リンクはラックの外へ出ていくため、従来の ToR 設計に比べて DAC の比率は小さくなります。詳細はケーブルの内部構造を参照してください。

コネクターと光ファイバーの選択

光学部品コネクター光ファイバー備考
400G DR4 / 800G DR8MPO-12 APC / MPO-16 APC(または 2 × MPO-12)SMF、Base-8/Base-16シングルモードのパラレルはどこでもAPC;モジュール側はピンあり、パッチコード側はピンなし
400G/800G SR8 / VR8MPO-16 UPCOM4/OM550–100 m;光学部品は安価、1メートルあたりの光ファイバーは高価
400G FR4 / 2×FR4デュプレックス LC / 2 × LCSMF光ファイバー本数が少ない、モジュール内部で WDM
NDR ツインポート OSFP2 × MPO-12 APCSMFモジュールあたり論理ポート2つ;分岐ケーブル 1:2 / 1:4(IB 配線
DAC / AECなしツインアックス両端に識別情報

MPO トランクは両端とも極性方式 B、4レーン光学部品には Base-8 トランクを使用します(ブレークアウトと MPO 配線)。

光学部品単体の電力と発熱

光学部品電力64ポートスイッチあたり
400G DR4 QSFP-DD8–12 W0.5–0.8 kW
800G DR8 / 2×FR4 OSFP14–18 W0.9–1.2 kW
400G AOC 端3–5 W
800G AEC 端4–6 W
DAC0

そのため、スイッチのフェースプレートには前面から背面への気流を妨げないことが求められます。スイッチではフィン付き OSFP、NIC ではフラットトップを使い、ケーブルの束が吸気を塞がないようにします(電力と熱温度と電圧)。ホストが対応していれば、リニア(LPO)光学部品はモジュールの消費電力をおおよそ半分に削減します(変調と DSP)。

設置と QA のチェックリスト

  1. すべての光学部品とケーブル端の受入検査:識別情報、チェックサム、DDM が生きているか、ベースラインの保存(製造と試験)。
  2. 導入前に、新しい光学部品を動作温度で24–72時間バーンインする。
  3. 設置時にすべての MPO を検査・清掃する(APC には APC 用スコープチップを使用)。検査していないコネクターを決して結合しない。
  4. 両端にラベルを付ける:ノード/GPU/NIC ↔ リーフ/ポート。分岐ケーブルは脚ごとに表示する。
  5. 曲げ半径と重量管理:DAC/AEC にはトレーと束ね、光ファイバーにはサービスループを使用する。
  6. 立ち上げ検証:すべてのリンクがフル速度・フル幅で動作し、FEC が有効で、レーンごとの Rx が近隣レーンと 2 dB 以内に収まり、アイドル時の前方誤り訂正前 BER が 10⁻⁷ 未満であること(VDM と FEC の指標)。
  7. レーンごとの DDM と識別情報を、ベースラインとしてファブリックマネージャー/CMDB に記録する。
  8. メディアクラスとコネクターごとに予備品を用意し、バーンイン済みの状態を保つ。

よくある設置不良

不良兆候
APC DR4 に UPC パッチ両端で全レーンが 3–10 dB 低下
極性を誤ったトランク全レーンが無信号
MPO の汚れ1〜2レーンが低下;該当レーンで前方誤り訂正前 BER が高い
ホストに対して DAC が長すぎる速度低下またはフラップ
分岐ケーブルの脚を取り違え誤った相手とリンク;ファブリックマネージャーのトポロジー不一致
フラットケージにフィン付き OSFP(またはその逆)装着できない/過熱

CodingBox では

この規模の受入検査は抜き取り検査ではなくワークフローです。CodingBox は各モジュールまたはケーブル端を読み取り、識別情報とチェックサムを検証し、レーンごとのライブ DDM をベースラインとして記録して、シリアル番号に紐づけてcode databaseに保存します。これにより、後にフラップしているポートから取り外したモジュールを、初日の状態と比較できます。


この記事に不正確な点や誤りを見つけた場合は、該当する箇所を選択して Ctrl+Enter を押すと、できます。