AI क्लस्टर में ट्रांसीवर
AI ट्रेनिंग क्लस्टर अब तक बने हाई-स्पीड ऑप्टिक्स के सबसे बड़े उपभोक्ता हैं, और वे मॉड्यूल को रेट, पावर और गिनती की सीमा तक धकेलते हैं। यहाँ जो इंजीनियरिंग मायने रखती है वह किसी एक लिंक की नहीं, बल्कि दसियों हज़ार लिंक को भरोसेमंद तरीक़े से चलाने की है।
कौन-से ऑप्टिक्स
| भूमिका | मॉड्यूल | सामान्य PMD | कनेक्टर |
|---|---|---|---|
| GPU सर्वर ↔ लीफ़ (scale-out, IB NDR) | OSFP ट्विन-पोर्ट 2×400G | DR4 ×2 | 2 × MPO-12 APC |
| GPU सर्वर ↔ लीफ़ (Ethernet) | QSFP-DD / OSFP 400G–800G | DR4, DR8, 2×FR4 | MPO-12/16 APC, डुअल LC |
| लीफ़ ↔ स्पाइन | 800G OSFP / QSFP-DD800 | DR8, 2×FR4 | MPO-16 APC, डुअल LC |
| रैक के अंदर छोटे हॉप | जहाँ रीच इजाज़त दे वहाँ DAC / AOC | — | — |
सिंगल-मोड DR ऑप्टिक्स का बोलबाला है क्योंकि ये 500 m तक पहुँचते हैं, जो किसी भी हॉल के लिए काफ़ी है, और एक ही फ़ाइबर प्लांट पर 400G से 800G तक स्केल करते हैं। कोणीय APC कनेक्टर ज़रूरी हैं।
पावर और गर्मी
एक 800G मॉड्यूल लगभग 14–18 W खींचता है; एक 64-पोर्ट स्विच फ़ेसप्लेट पर एक किलोवाट के बराबर ऑप्टिक्स होते हैं। OSFP की इंटीग्रेटेड हीट सिंक की वजह से इसे सबसे गर्म मॉड्यूल के लिए पसंद किया जाता है; QSFP-DD होस्ट की कूलिंग पर निर्भर करता है। थर्मल थ्रॉटलिंग, यानी ओवरहीट होने पर मॉड्यूल का ख़ुद को पीछे खींचना, आती-जाती 400G/800G फ़्लैप की एक असली वजह है (CMIS समस्याएँ)।
लीनियर-ड्राइव प्लगेबल ऑप्टिक्स (LPO) पावर और लेटेंसी घटाने के लिए मॉड्यूल का DSP हटा देते हैं, और इक्वलाइज़ेशन को स्विच ASIC पर ले जाते हैं; ये उन छोटे DR लिंक पर दिखने लगे हैं जहाँ होस्ट इन्हें सपोर्ट करता है।
बड़े पैमाने पर विश्वसनीयता
गणित सब कुछ बदल देता है: 100 000 ऑप्टिक्स के साथ, 0.5% की सालाना विफलता दर का मतलब भी है हफ़्ते में दस बदलाव। नतीजे:
- ट्रेनिंग स्टेप रुकने से पहले बिगड़ते मॉड्यूल को बदलने के लिए पूरे फ़्लीट में प्रति-लेन DDM मॉनिटरिंग, ट्रेंड के साथ (विफलताएँ)।
- बैच के अनुसार स्पेयर और इनकमिंग इंस्पेक्शन: विफलताएँ प्रोडक्शन लॉट के हिसाब से समूहों में होती हैं।
- MPO की सफ़ाई का अनुशासन: हर कनेक्टर में 16 फ़ाइबर, और एक कण भी किसी लेन को गिरा सकता है (लिंक फ़्लैपिंग)।
- एक अकेली धीमी लेन पूरे सामूहिक संचालन (collective) को धीमा कर देती है: मेट्रिक टेल लेटेंसी है।
पहचान जानकारी और इंटरऑपरेबिलिटी
बड़े क्लस्टर क्वालिफ़ाई किए गए मॉड्यूल की एक छोटी सूची पर मानकीकृत होते हैं, और स्विच प्लेटफ़ॉर्म पहचान जानकारी की पुष्टि करते हैं। थर्ड-पार्टी 400G/800G ऑप्टिक्स वहाँ इस्तेमाल होते हैं जहाँ प्लेटफ़ॉर्म उन्हें सहन करता है, और जहाँ नहीं करता वहाँ उन्हें अपेक्षित पहचान जानकारी पर कोड किया जाता है, यानी बाक़ी जगहों जैसे ही विक्रेता लॉक के नियम, बस यूनिट की लागत कहीं ज़्यादा।
आगे क्या है
1.6T पोर्ट (OSFP-XD, 16 लेन) और 200G-प्रति-लेन इलेक्ट्रिकल इंटरफ़ेस अगला क़दम हैं; सबसे बड़े सिस्टम के लिए को-पैकेज्ड ऑप्टिक्स ट्रांसीवर को स्विच के पैकेज के अंदर ले जाते हैं।
CodingBox में
CodingBox CMIS के ज़रिए 400G/800G OSFP और QSFP-DD मॉड्यूल पढ़ता है: मॉड्यूल की स्थिति, ऐप्लिकेशन विज्ञापन, पहचान जानकारी, और DDM स्क्रीन पर प्रति-लेन Tx/Rx/bias, यानी वह डेटा जो किसी ऑपरेटर को इनकमिंग बैच को क्वालिफ़ाई करने, नए लिंक की बेसलाइन बनाने और आठ में से किसी एक विफल लेन को पहचानने के लिए चाहिए।
इन विकल्पों को केबल की गिनती, दूरी और इंस्टॉलेशन चेकलिस्ट में बदलना: AI क्लस्टर की केबलिंग; इंस्टॉल होने के बाद लिंक को चालू रखना: लिंक विश्वसनीयता और मॉनिटरिंग।
ख़ुद 1.6T मॉड्यूल: लेन, पावर, बैंक, संगतता: OSFP224, OSFP-XD।