AI ネットワーキングの概要
大規模 AI モデルの学習では、多数のサーバーにまたがる多数の GPU に処理が分散されます。クラスターの学習速度を左右するのは、多くの場合1基1基の GPU ではなく、それらの間のネットワークです。だからこそ AI ファブリックは、入手可能な中で最も帯域幅の大きい光トランシーバーに頼るのです。
ネットワークが重要な理由
- 集団通信:GPU は勾配とパラメーターを all-to-all パターンで絶えず交換し、大量の東西トラフィックを生み出します。
- テールレイテンシーが重要:各ステップは最も遅いリンクを待つため、一貫して低いレイテンシーとロスレスな伝送が欠かせません。
- 規模:数千基の GPU は、高密度・高ラディックスのスイッチと膨大な数の光学部品を意味します。
2つのファブリック方式
- InfiniBand:HPC で長く確立されており、RDMA とロスレスフロー制御を備えます(InfiniBandを参照)。
- RoCE を使った Ethernet:Converged Ethernet 上の RDMA であり、ロスレス Ethernet 上で大規模 AI 向けに採用が増えています。
光学部品
AI リンクは通常、QSFP-DD と OSFP モジュール上で400G と 800Gです。具体的なインターコネクトの選択と光学部品についてはAI インターコネクトと光学部品で扱います。
使われるフォームファクターや管理メモリは同じです。CodingBox は、これらの高レートモジュールも他のモジュールと同じように読み取ります。
さらに詳しく
- AI クラスターの配線 — GPU あたりのリンク数、レール最適化レイアウトにおける距離、DAC/AEC/AOC/DR の組み合わせ、コネクターの選択、光学部品の電力、設置 QA。
- AI ファブリックにおけるリンクの信頼性と監視 — 1本のリンクがなぜジョブを止めるのか、FIT の算数、予測指標、監視アーキテクチャ、切り分けと予防。