AI 네트워킹 개요
대형 AI 모델을 학습시키는 작업은 여러 서버에 걸친 수많은 GPU로 나뉘어 처리됩니다. 클러스터가 얼마나 빨리 학습할 수 있는지를 좌우하는 것은 흔히 개별 GPU가 아니라 GPU들 사이의 네트워크이며, 그래서 AI 패브릭은 구할 수 있는 가장 높은 대역폭의 광 트랜시버에 의존합니다.
네트워크가 결정적인 이유
- 집합 통신 연산 — GPU는 그레이디언트와 파라미터를 all-to-all 패턴으로 끊임없이 주고받으며, 무거운 동서(east-west) 트래픽을 만들어 냅니다.
- 테일 레이턴시가 중요합니다 — 각 스텝은 가장 느린 링크를 기다리므로, 일관되게 낮은 지연과 무손실 전달이 필수적입니다.
- 규모 — 수천 개의 GPU가 있으면 밀도 높고 포트 수가 많은(high-radix) 스위치와 막대한 수의 광학 부품이 필요합니다.
두 가지 패브릭 방식
- InfiniBand — HPC에서 오랫동안 자리 잡아 온 방식으로, RDMA와 무손실 흐름 제어를 갖추고 있습니다(InfiniBand 참고).
- RoCE를 사용하는 이더넷 — 컨버지드 이더넷 위에서 동작하는 RDMA(RDMA over Converged Ethernet)로, 무손실 이더넷 위에서 대규모 AI에 점점 더 많이 쓰입니다.
광학 부품
AI 링크는 대개 QSFP-DD와 OSFP 모듈에서 400G와 800G입니다. 구체적인 인터커넥트 선택지와 광학 부품은 AI 인터커넥트와 광학 부품에서 다룹니다.
동일한 폼 팩터와 관리 메모리가 적용됩니다 — CodingBox는 이런 고속 모듈도 다른 모듈과 똑같이 읽습니다.
더 읽어보기
- AI 클러스터 배선 — GPU당 링크 수, 레일 최적화 배치에서의 거리, DAC/AEC/AOC/DR 조합, 커넥터 선택, 광학 부품 전력, 설치 QA.
- AI 패브릭의 링크 신뢰성과 모니터링 — 링크 하나가 작업 전체를 멈추게 하는 이유, FIT 계산, 예측 지표, 모니터링 아키텍처, 격리와 예방.