CodingBox ドキュメント

AI クラスターのトランシーバー

AI 学習クラスターは、これまでに構築された中で最大の高速光学部品の消費者であり、レート、電力、数量のあらゆる面でモジュールを限界まで酷使します。重要なのは1本1本のリンクよりも、その数万本を確実に稼働させ続けるエンジニアリングです。

どの光学部品を使うか

役割モジュール一般的な PMDコネクター
GPU サーバー ↔ リーフ(スケールアウト、IB NDR)OSFP ツインポート 2×400GDR4 ×22 × MPO-12 APC
GPU サーバー ↔ リーフ(Ethernet)QSFP-DD / OSFP 400G–800GDR4、DR8、2×FR4MPO-12/16 APC、デュプレックス LC
リーフ ↔ スパイン800G OSFP / QSFP-DD800DR8、2×FR4MPO-16 APC、デュプレックス LC
ラック内の短距離区間伝送距離が許せば DAC / AOC

シングルモード DR 光学部品が主流なのは、500 m まで届き(どのホールにも十分な距離です)、同じ光ファイバー設備のまま 400G から 800G までスケールできるためです。斜め研磨の APC コネクターが必須です。

電力と発熱

800G モジュールはおよそ 14–18 W を消費します。64ポートスイッチのフェースプレートには、光学部品だけで1キロワット分が搭載されます。OSFP は内蔵ヒートシンクを備えているため、最も発熱の大きいモジュールに好まれます。QSFP-DD はホスト側の冷却に依存します。サーマルスロットリング(モジュールが過熱時に出力を抑える現象)は、断続的な 400G/800G のフラップの実際の原因になります(CMIS の問題)。

リニアドライブプラガブル光学部品(LPO)はモジュールの DSP を取り除いて消費電力とレイテンシーを削減し、イコライゼーションをスイッチ ASIC 側に移します。ホストが対応している短距離 DR リンクで採用が進んでいます。

大規模環境での信頼性

規模が変わればすべてが変わります。100 000個の光学部品があれば、年間故障率がわずか 0.5% でも、週に10個の交換が必要になります。その帰結は次のとおりです。

  • フリート全体でレーンごとの DDM を監視し、傾向を追うことで、劣化したモジュールが学習ステップを止める前に交換する(故障)。
  • バッチ単位での予備品確保と受入検査。故障は製造ロットごとに偏って発生する。
  • MPO の清潔さの徹底:1コネクターに16心、粒子1個でも1レーンがダウンする(リンクフラッピング)。
  • 1レーンの遅延が集団通信全体を遅くする。指標になるのはテールレイテンシーです。

識別情報と相互運用性

大規模クラスターは、認定済みモジュールの短いリストに標準化しており、スイッチプラットフォームは識別情報を検証します。サードパーティの 400G/800G 光学部品は、プラットフォームが許容する場合はそのまま使われ、許容しない場合は期待される識別情報にコーディングされます。他の場面と同じベンダーロックのルールですが、単価ははるかに高くなります。

この先の展望

1.6T ポート(OSFP-XD、16レーン)と、レーンあたり 200G の電気インターフェースが次のステップです。最大規模のシステムでは、コパッケージ光学部品がトランシーバーをスイッチのパッケージ内に取り込みます。

CodingBox では

CodingBox は、CMISを通じて 400G/800G の OSFP と QSFP-DD モジュールを読み取ります。モジュールの状態、アプリケーションアドバタイズメント、識別情報、そしてDDM画面でのレーンごとの Tx/Rx/バイアスです。これらは、運用者が入荷バッチを検定し、新規リンクをベースライン化し、8レーンのうち故障している1レーンを特定するために必要なデータです。

これらの選択をケーブル本数、距離、設置チェックリストに落とし込む方法についてはAI クラスターの配線を、設置後にリンクを維持する方法についてはリンクの信頼性と監視を参照してください。

1.6T モジュール自体(レーン、電力、バンク、互換性)についてはOSFP224OSFP-XDを参照してください。


この記事に不正確な点や誤りを見つけた場合は、該当する箇所を選択して Ctrl+Enter を押すと、できます。