GPU ファブリックのトポロジー
AI クラスターのネットワークは層状に構築されており、層ごとに異なるインターコネクト、そして異なる光学部品を使用します。各層を理解すれば、クラスターになぜこれほど多くのトランシーバーがあるのか、そして不良品が出たときにどこが最も痛手を受けるのかが分かります。
スケールアップとスケールアウト
| スケールアップ | スケールアウト | |
|---|---|---|
| 接続対象 | サーバーまたはラック内の GPU 同士 | サーバー同士 |
| 技術 | 独自の GPU 間リンク(例:NVLink/NVSwitch) | InfiniBand または Ethernet/RoCE |
| メディア | 銅製バックプレーンとケーブル、ラック間では光学部品が増加中 | プラガブル光学部品:400G/800G OSFP、QSFP-DD |
| GPU あたりの帯域幅 | 最高 | 高いが、ファブリックと共有 |
プラガブルトランシーバーの大半はスケールアウト層にあります。GPU サーバー1台ごとに、ファブリック向けの 400G/800G ポートが複数あるほか、フロントエンド/ストレージ用のネットワークも別途存在します。
ファットツリーとノンブロッキング
スケールアウトファブリックは通常ファットツリー(Clos)構成です。リーフスイッチがサーバーを接続し、スパインスイッチがリーフ同士を接続し、どのサーバーもフルレートで他のどのサーバーとも通信できるだけの十分なリーフ・スパイン間アップリンクを備えています(ノンブロッキング)。クラスターの光学部品の大半は、このリーフ・スパイン間およびサーバー・リーフ間リンクであり、同一の DR4/DR8 モジュールが数千個に及びます。
レール最適化設計
学習トラフィックの大半は、サーバーをまたいだ同じランクの GPU 間で行われる集団通信が占めます。レール最適化トポロジーはこれを利用します。各サーバーの GPU 0 はリーフスイッチ 0 に、GPU 1 はリーフ 1 に、という具合に接続されるため、同じランクの GPU 同士は1ホップで到達でき、集団通信がスパインを越えることはありません。光学部品への影響は次のとおりです。1本のレールの障害は、すべてのサーバーで同じ GPU の位置に影響を与えます。これは認識しておく価値のあるパターンです。
分離されたネットワーク
クラスターは通常、物理的に分離された複数のファブリックを運用します。
- コンピュートファブリック:GPU 間(IB または RoCE)、最大規模で最も光学部品を多用する。
- ストレージファブリック:並列ファイルシステムとオブジェクトストレージへ、多くの場合 Ethernet を使用(ストレージネットワーキング)。
- フロントエンド/管理:ユーザーアクセス、オーケストレーション、テレメトリー。
それぞれが独自の光学部品在庫と独自のベンダー検証ルールを持ちます。
1本の不良リンクがこれほど重要な理由
集団通信は、最も遅い参加者の速度で完了します。あるトランシーバーの1レーンが劣化している場合(FEC の訂正数が増える、時折再送が起きるなど)、各ステップのテールレイテンシーが伸び、クラスター全体のスループットの無視できない割合を損なうことがあります。だからこそ、AI 運用者はレーンごとの DDM をフリート全体で傾向分析し、光学部品を予防的に交換します(AI クラスターにおけるトランシーバー)。
CodingBox では
レールに組み込む前に、ベンチで光学部品を検定します。CMISに基づく識別情報、DDM画面でのレーンごとの DDM ベースライン、そしてcode databaseへの記録があれば、レールでエラーが出始めたときにモジュールの履歴を参照できます。
これらのファブリックの GPU 側にあるアダプター(BlueField、ConnectX-8 SuperNIC、Pensando)とそのツインポート OSFP 光学部品についてはSmartNIC と DPUを参照してください。