CodingBox 문서

GPU 패브릭 토폴로지

AI 클러스터의 네트워크는 여러 계층으로 구성되며, 각 계층은 서로 다른 인터커넥트와 서로 다른 광학 부품을 사용합니다. 이 계층 구조를 이해하면 클러스터에 왜 그렇게 많은 트랜시버가 필요한지, 불량 하나가 어디서 가장 큰 타격을 주는지 알 수 있습니다.

스케일업과 스케일아웃

스케일업스케일아웃
연결 대상서버 또는 랙 내부의 GPU서버와 서버
기술독점 GPU-GPU 링크(예: NVLink/NVSwitch)InfiniBand 또는 이더넷/RoCE
매체구리 백플레인과 케이블; 랙 사이에는 광학 부품 비중이 늘어나는 추세플러거블 광학 부품: 400G/800G OSFP, QSFP-DD
GPU당 대역폭가장 높음높지만 패브릭과 공유

플러거블 트랜시버는 주로 스케일아웃 계층에 있습니다 — 모든 GPU 서버는 패브릭 방향으로 여러 개의 400G/800G 포트를 가지며, 여기에 별도의 프런트엔드/스토리지 네트워킹이 더해집니다.

팻트리와 논블로킹

스케일아웃 패브릭은 보통 팻트리(Clos) 구조입니다: 리프 스위치가 서버를 연결하고, 스파인 스위치가 리프를 연결하며, 어떤 서버든 전체 속도로 다른 서버와 통신할 수 있을 만큼 충분한 리프-스파인 업링크를 둡니다(논블로킹). 클러스터 광학 부품의 대부분은 이 리프-스파인 링크와 서버-리프 링크이며, 수천 개의 동일한 DR4/DR8 모듈로 이루어집니다.

레일 최적화 설계

학습 트래픽은 서버 전체에서 동일한 랭크(rank)의 GPU 사이에 오가는 집합 통신 연산이 대부분을 차지합니다. 레일 최적화 토폴로지는 이 점을 활용합니다: 모든 서버의 GPU 0은 리프 스위치 0에, GPU 1은 리프 1에 연결하는 식으로 이어지므로, 동일한 랭크의 GPU는 한 홉 거리에 있고 집합 통신은 스파인을 건너지 않습니다. 광학 부품 관점에서의 결과: 레일 하나의 장애는 모든 서버에서 동일한 GPU 위치에 영향을 미칩니다 — 알아 둘 만한 패턴입니다.

분리된 네트워크

클러스터는 보통 물리적으로 분리된 여러 패브릭을 운영합니다.

  • 컴퓨트 패브릭 — GPU-GPU(IB 또는 RoCE), 가장 크고 광학 부품이 가장 많이 들어감.
  • 스토리지 패브릭 — 병렬 파일 시스템과 오브젝트 스토리지로 연결, 흔히 이더넷(스토리지 네트워킹).
  • 프런트엔드/관리 — 사용자 접근, 오케스트레이션, 텔레메트리.

각 패브릭은 저마다의 광학 부품 재고와 벤더 검증 규칙을 갖습니다.

링크 하나의 불량이 크게 문제되는 이유

집합 통신 연산은 가장 느린 참여자의 속도로 완료됩니다. 레인 하나가 열화된 트랜시버 하나 — FEC 정정이 늘고 이따금 재전송이 일어나는 정도라도 — 가 모든 스텝의 테일 레이턴시를 늘리며, 클러스터 전체 처리량의 무시할 수 없는 비율을 갉아먹을 수 있습니다. AI 운영자들이 전체 장비군에 걸쳐 레인별 DDM 추이를 지켜보고 광학 부품을 선제적으로 교체하는 이유가 여기에 있습니다(AI 클러스터의 트랜시버).

CodingBox에서

레일에 투입하기 전에 벤치에서 광학 부품을 검증합니다: CMIS에 따른 식별 정보, DDM 화면의 레인별 DDM 기준값, code database에 남긴 기록 — 이렇게 하면 레일에서 오류가 나타나기 시작할 때 모듈 이력을 바로 확인할 수 있습니다.

이런 패브릭의 GPU 쪽 어댑터 — BlueField, ConnectX-8 SuperNIC, Pensando — 와 이들의 트윈포트 OSFP 광학 부품: SmartNIC과 DPU.


이 문서에서 부정확한 내용이나 오류를 발견하면 해당 부분을 선택하고 Ctrl+Enter를 눌러 해 주세요.