CodingBox ドキュメント

AI ネットワーキングの概要

大規模 AI モデルの学習では、多数のサーバーにまたがる多数の GPU に処理が分散されます。クラスターの学習速度を左右するのは、多くの場合1基1基の GPU ではなく、それらの間のネットワークです。だからこそ AI ファブリックは、入手可能な中で最も帯域幅の大きい光トランシーバーに頼るのです。

ネットワークが重要な理由

  • 集団通信:GPU は勾配とパラメーターを all-to-all パターンで絶えず交換し、大量の東西トラフィックを生み出します。
  • テールレイテンシーが重要:各ステップは最も遅いリンクを待つため、一貫して低いレイテンシーとロスレスな伝送が欠かせません。
  • 規模:数千基の GPU は、高密度・高ラディックスのスイッチと膨大な数の光学部品を意味します。

2つのファブリック方式

  • InfiniBand:HPC で長く確立されており、RDMA とロスレスフロー制御を備えます(InfiniBandを参照)。
  • RoCE を使った Ethernet:Converged Ethernet 上の RDMA であり、ロスレス Ethernet 上で大規模 AI 向けに採用が増えています。

光学部品

AI リンクは通常、QSFP-DD と OSFP モジュール上で400G と 800Gです。具体的なインターコネクトの選択と光学部品についてはAI インターコネクトと光学部品で扱います。

使われるフォームファクターや管理メモリは同じです。CodingBox は、これらの高レートモジュールも他のモジュールと同じように読み取ります。

さらに詳しく


この記事に不正確な点や誤りを見つけた場合は、該当する箇所を選択して Ctrl+Enter を押すと、できます。