AI クラスターのケーブリング:本数、距離、メディア、品質確認
GPU クラスターの大部分はケーブルでできています。1ノードに8基の GPU があれば、8本の 400G(または 800G)スケールアウトリンクに加えて管理系とストレージ系の配線が必要になります。GPU が1 000基あれば、2〜3段のスイッチ層にまたがる数千の光学端点があり、そのどれもが学習を止めかねません。このページでは、GPU ファブリックで示したファブリック設計を、ケーブル本数、伝送距離クラス、コネクターの選択、設置チェックリストに落とし込みます。
リンク数の算出
1 GPU あたり 400G NIC を1枚搭載した、典型的な8-GPU ノードでのレール最適化2段ファブリックの場合。
| 項目 | 計算式 | 1 024 GPU(128ノード) |
|---|---|---|
| GPU–リーフ間リンク | GPU × 1 | 1 024 × 400G |
| リーフ–スパイン間リンク(ノンブロッキング) | = GPU–リーフ | 1 024 × 400G |
| 光/ケーブルの端点(1リンクにつき2) | リンク × 2 | 4 096 |
| ストレージ+管理用 NIC | 1ノードあたり2–4 | さらに256–512リンク |
| 予備の光学部品(3–5 %) | — | 150–250 |
NDR のツインポートスイッチモジュール(OSFP 1台あたり 2 × 400G)を使うと、スイッチ側のモジュール数は半分になりますが、光ファイバー数は半分になりません。3段構成では、GPU 1 024基につきさらに1 024本のスパイン–コア間リンクが追加されます。これらの端点のひとつひとつが、識別情報と DDM を持つトランシーバーまたはケーブルプラグです(リンクの信頼性と監視)。
レール最適化レイアウトにおける距離
| セグメント | 一般的な距離 | メディア |
|---|---|---|
| GPU NIC → リーフ、同一ラック内 | ≤ 2 m | パッシブ DAC(400G ≤ 2 m;800G ≤ 1–1.5 m)— 最も安価、消費電力ゼロ、重い |
| GPU NIC → リーフ、隣接ラック(レールグループは1列に広がる) | 3–10 m | AEC(≤ 3–5 m)または MMF 上の AOC/SR トランシーバー |
| リーフ → スパイン、同一ホール内 | 10–100 m | AOC は ~50–100 m まで;OM4 上の SR4/SR8 / VR は ≤ 50–100 m;SMF 上の DR4/DR8 は 500 m — 400G 以上では DR が主流になりつつある |
| スパイン → コア/ホール間 | 100 m – 2 km | シングルモードの DR4 / FR4 / 2×FR4 |
| 建物間 DCI | 2–80 km | LR4、ZR/ZR+(コヒーレントと長距離伝送) |
レール最適化配線では、各ノードの GPU i をリーフ i に接続するため、1ノードの8本のケーブルは8台の異なるリーフへ分岐します。ほとんどの GPU–リーフ間リンクはラックの外へ出ていくため、従来の ToR 設計に比べて DAC の比率は小さくなります。詳細はケーブルの内部構造を参照してください。
コネクターと光ファイバーの選択
| 光学部品 | コネクター | 光ファイバー | 備考 |
|---|---|---|---|
| 400G DR4 / 800G DR8 | MPO-12 APC / MPO-16 APC(または 2 × MPO-12) | SMF、Base-8/Base-16 | シングルモードのパラレルはどこでもAPC;モジュール側はピンあり、パッチコード側はピンなし |
| 400G/800G SR8 / VR8 | MPO-16 UPC | OM4/OM5 | 50–100 m;光学部品は安価、1メートルあたりの光ファイバーは高価 |
| 400G FR4 / 2×FR4 | デュプレックス LC / 2 × LC | SMF | 光ファイバー本数が少ない、モジュール内部で WDM |
| NDR ツインポート OSFP | 2 × MPO-12 APC | SMF | モジュールあたり論理ポート2つ;分岐ケーブル 1:2 / 1:4(IB 配線) |
| DAC / AEC | なし | ツインアックス | 両端に識別情報 |
MPO トランクは両端とも極性方式 B、4レーン光学部品には Base-8 トランクを使用します(ブレークアウトと MPO 配線)。
光学部品単体の電力と発熱
| 光学部品 | 電力 | 64ポートスイッチあたり |
|---|---|---|
| 400G DR4 QSFP-DD | 8–12 W | 0.5–0.8 kW |
| 800G DR8 / 2×FR4 OSFP | 14–18 W | 0.9–1.2 kW |
| 400G AOC 端 | 3–5 W | — |
| 800G AEC 端 | 4–6 W | — |
| DAC | 0 | — |
そのため、スイッチのフェースプレートには前面から背面への気流を妨げないことが求められます。スイッチではフィン付き OSFP、NIC ではフラットトップを使い、ケーブルの束が吸気を塞がないようにします(電力と熱、温度と電圧)。ホストが対応していれば、リニア(LPO)光学部品はモジュールの消費電力をおおよそ半分に削減します(変調と DSP)。
設置と QA のチェックリスト
- すべての光学部品とケーブル端の受入検査:識別情報、チェックサム、DDM が生きているか、ベースラインの保存(製造と試験)。
- 導入前に、新しい光学部品を動作温度で24–72時間バーンインする。
- 設置時にすべての MPO を検査・清掃する(APC には APC 用スコープチップを使用)。検査していないコネクターを決して結合しない。
- 両端にラベルを付ける:ノード/GPU/NIC ↔ リーフ/ポート。分岐ケーブルは脚ごとに表示する。
- 曲げ半径と重量管理:DAC/AEC にはトレーと束ね、光ファイバーにはサービスループを使用する。
- 立ち上げ検証:すべてのリンクがフル速度・フル幅で動作し、FEC が有効で、レーンごとの Rx が近隣レーンと 2 dB 以内に収まり、アイドル時の前方誤り訂正前 BER が 10⁻⁷ 未満であること(VDM と FEC の指標)。
- レーンごとの DDM と識別情報を、ベースラインとしてファブリックマネージャー/CMDB に記録する。
- メディアクラスとコネクターごとに予備品を用意し、バーンイン済みの状態を保つ。
よくある設置不良
| 不良 | 兆候 |
|---|---|
| APC DR4 に UPC パッチ | 両端で全レーンが 3–10 dB 低下 |
| 極性を誤ったトランク | 全レーンが無信号 |
| MPO の汚れ | 1〜2レーンが低下;該当レーンで前方誤り訂正前 BER が高い |
| ホストに対して DAC が長すぎる | 速度低下またはフラップ |
| 分岐ケーブルの脚を取り違え | 誤った相手とリンク;ファブリックマネージャーのトポロジー不一致 |
| フラットケージにフィン付き OSFP(またはその逆) | 装着できない/過熱 |
CodingBox では
この規模の受入検査は抜き取り検査ではなくワークフローです。CodingBox は各モジュールまたはケーブル端を読み取り、識別情報とチェックサムを検証し、レーンごとのライブ DDM をベースラインとして記録して、シリアル番号に紐づけてcode databaseに保存します。これにより、後にフラップしているポートから取り外したモジュールを、初日の状態と比較できます。