AI 클러스터의 트랜시버
AI 학습 클러스터는 지금까지 구축된 것 중 고속 광학 부품을 가장 많이 소비하는 시스템이며, 모듈을 속도, 전력, 수량 면에서 한계까지 밀어붙입니다. 여기서 중요한 것은 링크 하나하나가 아니라 수만 개를 안정적으로 운용하는 엔지니어링입니다.
어떤 광학 부품을 쓰는가
| 역할 | 모듈 | 일반적인 PMD | 커넥터 |
|---|---|---|---|
| GPU 서버 ↔ 리프(스케일아웃, IB NDR) | OSFP 트윈포트 2×400G | DR4 ×2 | 2 × MPO-12 APC |
| GPU 서버 ↔ 리프(이더넷) | QSFP-DD / OSFP 400G–800G | DR4, DR8, 2×FR4 | MPO-12/16 APC, 듀얼 LC |
| 리프 ↔ 스파인 | 800G OSFP / QSFP-DD800 | DR8, 2×FR4 | MPO-16 APC, 듀얼 LC |
| 랙 내부 단거리 구간 | 전송 거리가 허용하는 범위에서 DAC / AOC | — | — |
싱글모드 DR 광학 부품이 주류인 이유는 500 m까지 도달해 어떤 홀에도 충분하고, 동일한 광섬유 설비에서 400G부터 800G까지 확장되기 때문입니다. 경사 연마된 APC 커넥터가 필요합니다.
전력과 발열
800G 모듈은 대략 14–18 W를 소비합니다; 64포트 스위치 전면판이면 광학 부품만으로 1킬로와트에 이릅니다. OSFP가 발열이 가장 큰 모듈에 선호되는 이유는 일체형 히트싱크 때문이며, QSFP-DD는 호스트의 냉각에 의존합니다. 열 스로틀링 — 모듈이 과열 시 출력을 낮추는 현상 — 은 간헐적인 400G/800G 플랩의 실제 원인입니다(CMIS 문제).
리니어 드라이브 플러거블 옵틱스(LPO)는 모듈의 DSP를 없애 전력과 지연을 줄이고, 등화 기능을 스위치 ASIC로 옮깁니다; 호스트가 지원하는 짧은 DR 링크에서 채택되기 시작했습니다.
대규모 환경에서의 신뢰성
규모가 커지면 계산이 완전히 달라집니다: 광학 부품 100 000개라면 연간 고장률이 0.5%에 불과해도 매주 10개를 교체해야 합니다. 그 결과:
- 전체 장비군에 걸친 레인별 DDM 모니터링과 추이 분석으로, 열화되는 모듈이 학습 스텝을 멈추기 전에 교체합니다(장애).
- 배치별 예비품과 입고 검사 — 고장은 생산 로트 단위로 몰려서 발생하는 경향이 있습니다.
- MPO 청결 관리 — 커넥터 하나에 광섬유 16가닥이 들어 있어, 입자 하나만으로도 레인 하나가 죽을 수 있습니다(링크 플래핑).
- 느린 레인 하나가 집합 통신 전체를 늦춥니다: 테일 레이턴시가 핵심 지표입니다.
식별 정보와 상호운용성
대형 클러스터는 검증된 소수의 모듈 목록으로 표준화하며, 스위치 플랫폼은 식별 정보를 검증합니다. 서드파티 400G/800G 광학 부품은 플랫폼이 허용하는 곳에서는 그대로 쓰이고, 허용하지 않는 곳에서는 기대하는 식별 정보로 코딩됩니다 — 다른 영역과 동일한 벤더 락 규칙이 적용되지만, 단가는 훨씬 높습니다.
다음 단계
1.6T 포트(OSFP-XD, 16레인)와 레인당 200G 전기 인터페이스가 다음 단계입니다; 코패키지 옵틱스는 초대형 시스템에서 트랜시버를 스위치 패키지 안으로 옮겨 놓습니다.
CodingBox에서
CodingBox는 CMIS를 통해 400G/800G OSFP와 QSFP-DD 모듈을 읽습니다: 모듈 상태, 애플리케이션 광고, 식별 정보, 그리고 DDM 화면의 레인별 Tx/Rx/바이어스 — 입고 배치를 검증하고, 새 링크의 기준값을 잡고, 8개 레인 중 고장 난 레인 하나를 찾아내는 데 필요한 데이터입니다.
이런 선택을 케이블 수량, 거리, 설치 체크리스트로 옮긴 내용: AI 클러스터 배선; 설치 후 링크를 유지하는 방법: 링크 신뢰성과 모니터링.