AI नेटवर्किंग का अवलोकन
बड़े AI मॉडल को ट्रेन करने का काम कई सर्वर में फैले कई GPU के बीच बँट जाता है। इनके बीच का नेटवर्क, न कि कोई एक GPU, अक्सर यह तय करता है कि कोई क्लस्टर कितनी तेज़ी से ट्रेन कर सकता है, इसीलिए AI फ़ैब्रिक उपलब्ध सबसे ज़्यादा बैंडविड्थ वाले ऑप्टिकल ट्रांसीवर पर निर्भर करते हैं।
नेटवर्क क्यों महत्वपूर्ण है
- सामूहिक संचालन (collectives): GPU लगातार all-to-all पैटर्न में ग्रेडिएंट और पैरामीटर का आदान-प्रदान करते हैं, जिससे भारी east-west ट्रैफ़िक पैदा होता है।
- टेल लेटेंसी मायने रखती है: कोई स्टेप सबसे धीमे लिंक का इंतज़ार करता है, इसलिए लगातार कम लेटेंसी और लॉसलेस डिलीवरी ज़रूरी है।
- स्केल: हज़ारों GPU का मतलब है सघन, हाई-रैडिक्स स्विच और ऑप्टिक्स की भारी गिनती।
फ़ैब्रिक की दो शैलियाँ
- InfiniBand: HPC में लंबे समय से स्थापित, RDMA और लॉसलेस फ़्लो कंट्रोल के साथ (देखें InfiniBand)।
- RoCE के साथ Ethernet: RDMA over Converged Ethernet, लॉसलेस Ethernet पर बड़े पैमाने के AI के लिए बढ़ते हुए इस्तेमाल में।
ऑप्टिक्स
AI लिंक आमतौर पर QSFP-DD और OSFP मॉड्यूल पर 400G और 800G होते हैं। इंटरकनेक्ट के विशिष्ट विकल्पों और ऑप्टिक्स की जानकारी AI इंटरकनेक्ट और ऑप्टिक्स में है।
यही फ़ॉर्म फ़ैक्टर और प्रबंधित मेमोरी यहाँ भी लागू होती है, CodingBox इन हाई-रेट मॉड्यूल को किसी भी दूसरे मॉड्यूल की तरह पढ़ता है।
आगे पढ़ें
- AI क्लस्टर की केबलिंग: हर GPU पर लिंक की गिनती, रेल-ऑप्टिमाइज़्ड लेआउट में दूरियाँ, DAC/AEC/AOC/DR का मिश्रण, कनेक्टर के विकल्प, ऑप्टिक्स की पावर, इंस्टॉलेशन QA।
- AI फ़ैब्रिक में लिंक विश्वसनीयता और मॉनिटरिंग: एक लिंक जॉब को क्यों रोक देता है, FIT का अंकगणित, पूर्वानुमान देने वाले मेट्रिक्स, मॉनिटरिंग आर्किटेक्चर, आइसोलेशन और रोकथाम।