CodingBox दस्तावेज़

GPU फ़ैब्रिक टोपोलॉजी

AI क्लस्टर का नेटवर्क परतों में बना होता है, और हर परत अलग इंटरकनेक्ट, और अलग ऑप्टिक्स इस्तेमाल करती है। परतों को समझने से यह साफ़ हो जाता है कि किसी क्लस्टर में इतने सारे ट्रांसीवर क्यों होते हैं और कोई ख़राब ट्रांसीवर सबसे ज़्यादा नुक़सान कहाँ पहुँचाता है।

स्केल-अप बनाम स्केल-आउट

स्केल-अपस्केल-आउट
कनेक्ट करता हैकिसी सर्वर या रैक के भीतर के GPUसर्वर को एक-दूसरे से
तकनीकप्रोप्राइटरी GPU-से-GPU लिंक (जैसे NVLink/NVSwitch)InfiniBand या Ethernet/RoCE
मीडियाकॉपर बैकप्लेन और केबल, रैक के बीच बढ़ते हुए ऑप्टिक्सप्लगेबल ऑप्टिक्स: 400G/800G OSFP, QSFP-DD
हर GPU पर बैंडविड्थसबसे ज़्यादाज़्यादा, फ़ैब्रिक के साथ साझा

प्लगेबल ट्रांसीवर मुख्यतः स्केल-आउट परत में होते हैं: हर GPU सर्वर में फ़ैब्रिक की ओर कई 400G/800G पोर्ट होते हैं, साथ ही अलग फ़्रंट-एंड/स्टोरेज नेटवर्किंग।

Fat-tree और नॉन-ब्लॉकिंग

स्केल-आउट फ़ैब्रिक आमतौर पर एक fat-tree (Clos) होता है: लीफ़ स्विच सर्वर को जोड़ते हैं, स्पाइन स्विच लीफ़ को जोड़ते हैं, और लीफ़-स्पाइन अपलिंक इतने होते हैं कि कोई भी सर्वर किसी भी दूसरे सर्वर से पूरी रेट पर बात कर सके (नॉन-ब्लॉकिंग)। क्लस्टर के ज़्यादातर ऑप्टिक्स यही लीफ़-स्पाइन और सर्वर-लीफ़ लिंक होते हैं: हज़ारों एक जैसे DR4/DR8 मॉड्यूल।

रेल-ऑप्टिमाइज़्ड डिज़ाइन

ट्रेनिंग ट्रैफ़िक पर सर्वर के आर-पार एक ही रैंक के GPU के बीच के सामूहिक संचालन (collectives) का दबदबा होता है। एक rail-optimised टोपोलॉजी इसी का फ़ायदा उठाती है: हर सर्वर का GPU 0 लीफ़ स्विच 0 से जुड़ता है, GPU 1 लीफ़ 1 से, और इसी तरह आगे, जिससे एक ही रैंक के GPU एक हॉप की दूरी पर रहते हैं और सामूहिक संचालन (collectives) कभी स्पाइन को पार नहीं करते। ऑप्टिक्स के लिए इसका नतीजा यह है: किसी एक रेल पर ख़राबी हर सर्वर में एक ही GPU स्थिति को प्रभावित करती है, यह एक ऐसा पैटर्न है जिसे पहचानना ज़रूरी है।

अलग नेटवर्क

एक क्लस्टर आमतौर पर कई भौतिक रूप से अलग फ़ैब्रिक चलाता है:

  • कंप्यूट फ़ैब्रिक: GPU-से-GPU (IB या RoCE), सबसे बड़ा और सबसे ज़्यादा ऑप्टिक्स वाला।
  • स्टोरेज फ़ैब्रिक: पैरेलल फ़ाइल सिस्टम और ऑब्जेक्ट स्टोरेज तक, अक्सर Ethernet (स्टोरेज नेटवर्किंग)।
  • फ़्रंट-एंड / मैनेजमेंट: यूज़र एक्सेस, ऑर्केस्ट्रेशन, टेलीमेट्री।

हर एक का अपना ऑप्टिक्स इन्वेंट्री और अपने विक्रेता-वैलिडेशन नियम होते हैं।

एक ख़राब लिंक इतना मायने क्यों रखता है

कोई सामूहिक संचालन (collective operation) अपने सबसे धीमे भागीदार की रफ़्तार पर पूरा होता है। किसी एक ट्रांसीवर की बिगड़ती हुई लेन, जैसे ज़्यादा FEC करेक्शन या कभी-कभार रीट्रांसमिट, हर चरण की टेल लेटेंसी को बढ़ा देती है और पूरे क्लस्टर के थ्रूपुट के एक मापने-लायक़ हिस्से की क़ीमत चुका सकती है। यही वजह है कि AI ऑपरेटर पूरे फ़्लीट में प्रति-लेन DDM का ट्रेंड देखते हैं और सक्रिय रूप से ऑप्टिक्स बदलते हैं (AI क्लस्टर में ट्रांसीवर)।

CodingBox में

किसी रेल में जाने से पहले ऑप्टिक्स को बेंच पर क्वालिफ़ाई करें: CMIS के अनुसार पहचान जानकारी, DDM स्क्रीन पर प्रति-लेन DDM बेसलाइन, और code database में एक रिकॉर्ड, ताकि जब कोई रेल त्रुटियाँ दिखाना शुरू करे तो मॉड्यूल का इतिहास उपलब्ध हो।

इन फ़ैब्रिक के GPU छोर पर लगे एडेप्टर, जैसे BlueField, ConnectX-8 SuperNIC, Pensando, और उनके ट्विन-पोर्ट OSFP ऑप्टिक्स: SmartNIC और DPU


अगर आपको इस सामग्री में कोई अशुद्धि या त्रुटि दिखे, तो संबंधित अंश चुनें और Ctrl+Enter दबाकर