GPU फ़ैब्रिक टोपोलॉजी
AI क्लस्टर का नेटवर्क परतों में बना होता है, और हर परत अलग इंटरकनेक्ट, और अलग ऑप्टिक्स इस्तेमाल करती है। परतों को समझने से यह साफ़ हो जाता है कि किसी क्लस्टर में इतने सारे ट्रांसीवर क्यों होते हैं और कोई ख़राब ट्रांसीवर सबसे ज़्यादा नुक़सान कहाँ पहुँचाता है।
स्केल-अप बनाम स्केल-आउट
| स्केल-अप | स्केल-आउट | |
|---|---|---|
| कनेक्ट करता है | किसी सर्वर या रैक के भीतर के GPU | सर्वर को एक-दूसरे से |
| तकनीक | प्रोप्राइटरी GPU-से-GPU लिंक (जैसे NVLink/NVSwitch) | InfiniBand या Ethernet/RoCE |
| मीडिया | कॉपर बैकप्लेन और केबल, रैक के बीच बढ़ते हुए ऑप्टिक्स | प्लगेबल ऑप्टिक्स: 400G/800G OSFP, QSFP-DD |
| हर GPU पर बैंडविड्थ | सबसे ज़्यादा | ज़्यादा, फ़ैब्रिक के साथ साझा |
प्लगेबल ट्रांसीवर मुख्यतः स्केल-आउट परत में होते हैं: हर GPU सर्वर में फ़ैब्रिक की ओर कई 400G/800G पोर्ट होते हैं, साथ ही अलग फ़्रंट-एंड/स्टोरेज नेटवर्किंग।
Fat-tree और नॉन-ब्लॉकिंग
स्केल-आउट फ़ैब्रिक आमतौर पर एक fat-tree (Clos) होता है: लीफ़ स्विच सर्वर को जोड़ते हैं, स्पाइन स्विच लीफ़ को जोड़ते हैं, और लीफ़-स्पाइन अपलिंक इतने होते हैं कि कोई भी सर्वर किसी भी दूसरे सर्वर से पूरी रेट पर बात कर सके (नॉन-ब्लॉकिंग)। क्लस्टर के ज़्यादातर ऑप्टिक्स यही लीफ़-स्पाइन और सर्वर-लीफ़ लिंक होते हैं: हज़ारों एक जैसे DR4/DR8 मॉड्यूल।
रेल-ऑप्टिमाइज़्ड डिज़ाइन
ट्रेनिंग ट्रैफ़िक पर सर्वर के आर-पार एक ही रैंक के GPU के बीच के सामूहिक संचालन (collectives) का दबदबा होता है। एक rail-optimised टोपोलॉजी इसी का फ़ायदा उठाती है: हर सर्वर का GPU 0 लीफ़ स्विच 0 से जुड़ता है, GPU 1 लीफ़ 1 से, और इसी तरह आगे, जिससे एक ही रैंक के GPU एक हॉप की दूरी पर रहते हैं और सामूहिक संचालन (collectives) कभी स्पाइन को पार नहीं करते। ऑप्टिक्स के लिए इसका नतीजा यह है: किसी एक रेल पर ख़राबी हर सर्वर में एक ही GPU स्थिति को प्रभावित करती है, यह एक ऐसा पैटर्न है जिसे पहचानना ज़रूरी है।
अलग नेटवर्क
एक क्लस्टर आमतौर पर कई भौतिक रूप से अलग फ़ैब्रिक चलाता है:
- कंप्यूट फ़ैब्रिक: GPU-से-GPU (IB या RoCE), सबसे बड़ा और सबसे ज़्यादा ऑप्टिक्स वाला।
- स्टोरेज फ़ैब्रिक: पैरेलल फ़ाइल सिस्टम और ऑब्जेक्ट स्टोरेज तक, अक्सर Ethernet (स्टोरेज नेटवर्किंग)।
- फ़्रंट-एंड / मैनेजमेंट: यूज़र एक्सेस, ऑर्केस्ट्रेशन, टेलीमेट्री।
हर एक का अपना ऑप्टिक्स इन्वेंट्री और अपने विक्रेता-वैलिडेशन नियम होते हैं।
एक ख़राब लिंक इतना मायने क्यों रखता है
कोई सामूहिक संचालन (collective operation) अपने सबसे धीमे भागीदार की रफ़्तार पर पूरा होता है। किसी एक ट्रांसीवर की बिगड़ती हुई लेन, जैसे ज़्यादा FEC करेक्शन या कभी-कभार रीट्रांसमिट, हर चरण की टेल लेटेंसी को बढ़ा देती है और पूरे क्लस्टर के थ्रूपुट के एक मापने-लायक़ हिस्से की क़ीमत चुका सकती है। यही वजह है कि AI ऑपरेटर पूरे फ़्लीट में प्रति-लेन DDM का ट्रेंड देखते हैं और सक्रिय रूप से ऑप्टिक्स बदलते हैं (AI क्लस्टर में ट्रांसीवर)।
CodingBox में
किसी रेल में जाने से पहले ऑप्टिक्स को बेंच पर क्वालिफ़ाई करें: CMIS के अनुसार पहचान जानकारी, DDM स्क्रीन पर प्रति-लेन DDM बेसलाइन, और code database में एक रिकॉर्ड, ताकि जब कोई रेल त्रुटियाँ दिखाना शुरू करे तो मॉड्यूल का इतिहास उपलब्ध हो।
इन फ़ैब्रिक के GPU छोर पर लगे एडेप्टर, जैसे BlueField, ConnectX-8 SuperNIC, Pensando, और उनके ट्विन-पोर्ट OSFP ऑप्टिक्स: SmartNIC और DPU।