CodingBox दस्तावेज़

AI फ़ैब्रिक में लिंक विश्वसनीयता और निगरानी

ट्रेनिंग जॉब हज़ारों GPU में फैला एक सिंक्रोनस कंप्यूटेशन है: हर सामूहिक संचालन (collective operation) सबसे धीमे लिंक का इंतज़ार करता है। एक फ़्लैप करता ट्रांसीवर किसी एक सर्वर को थोड़ा धीमा नहीं करता, वह पूरे जॉब को रोक देता है, और अगर वह पूरी तरह विफल हो जाए तो जॉब आख़िरी चेकपॉइंट से दोबारा शुरू होता है। इसलिए ऑप्टिक्स सिर्फ़ एक कंपोनेंट न रहकर एक विश्वसनीयता बजट बन जाते हैं। यह पेज विफलता का गणित, समस्या का पूर्वानुमान देने वाले मेट्रिक्स, फ़ैब्रिक ख़राब लिंक की निगरानी और आइसोलेशन कैसे करते हैं, और विफलता दर को कम रखने वाली परिचालन प्रक्रियाएँ शामिल करता है।

एक लिंक क्यों मायने रखता है

घटनाट्रेनिंग जॉब पर असर
लिंक फ़्लैप (सेकंड)collectives टाइम-आउट होते हैं या रीट्राई करते हैं; स्टेप टाइम में उछाल आता है; NCCL/RCCL के साथ काफ़ी लंबा रुकाव जॉब को ऐबॉर्ट कर देता है
घटी हुई स्पीड/चौड़ाई पर लिंकहर all-reduce इसी की रफ़्तार से चलता है; पूरे क्लस्टर का थ्रूपुट उस लिंक के हिस्से तक गिर जाता है
बढ़ा हुआ pre-FEC BER, कोई अनकरेक्टेबल नहींअभी कुछ नहीं, लेकिन मार्जिन ख़त्म हो चुका है; अगली गर्म दोपहर में यह फ़्लैप करेगा
अनकरेक्टेबल FEC त्रुटियाँपैकेट लॉस → RDMA रीट्रांसमिशन स्टॉर्म → रुकाव
हार्ड फ़ेल्योरचेकपॉइंट से जॉब रीस्टार्ट: पूरे क्लस्टर में मिनटों से लेकर एक घंटे तक का कंप्यूट नुक़सान

हज़ार-GPU जॉब पर चेकपॉइंट रीस्टार्ट की लागत GPU-घंटों में मापी जाती है; बेहतर ऑप्टिक्स और बेहतर QA की क़ीमत से तुलना इसी संख्या से करनी चाहिए।

विफलता का अंकगणित

ट्रांसीवर की विश्वसनीयता FIT (10⁹ डिवाइस-घंटों में विफलताएँ) या MTBF में बताई जाती है।

धारणावैल्यू
फ़ैब्रिक में ऑप्टिकल सिरे4 000 (एक 1 024-GPU दो-टियर क्लस्टर)
हर सिरे पर FIT (परिपक्व 400G ऑप्टिक्स, अच्छी तरह ठंडा किया गया)200–500
हर महीने अपेक्षित हार्ड फ़ेल्योर4 000 × 350 × 10⁻⁹ × 720 h ≈ 1
व्यवहार में देखी गई link flap दरहार्ड फ़ेल्योर से 5–20 × ज़्यादा: गंदगी, मार्जिनल मार्जिन, थर्मल, फ़र्मवेयर

तो हार्ड फ़ेल्योर दुर्लभ और अनुमान लगाने लायक़ हैं; फ़्लैप और डिग्रेडेड लिंक का बोलबाला है, और ये ज़्यादातर रोके जा सकते हैं, इसीलिए मॉनिटरिंग और QA अपनी लागत ख़ुद वसूल लेते हैं।

समस्याओं का पूर्वानुमान देने वाले मेट्रिक्स

मेट्रिकस्रोतस्वस्थकार्रवाई
प्रति-लेन Pre-FEC BERCMIS VDM; होस्ट FEC काउंटर< 10⁻⁷> 10⁻⁶ बढ़ रहा हो; > 10⁻⁵ पर बदलाव शेड्यूल करें
FEC अनकरेक्टेबल कोडवर्डहोस्ट0कोई भी बढ़ोतरी = इंसिडेंट
प्रति-लेन सिंबल त्रुटियाँहोस्ट (Ethernet) / perfquery (IB)संतुलित, शून्य के क़रीबएक लेन हावी हो
बेसलाइन बनाम प्रति-लेन Rx पावरDDMपहले दिन के 1 dB के भीतर, लेन आपस में 2 dB के भीतरबेसलाइन से −2 dB
Tx bias का ट्रेंडDDMसपाटबेसलाइन से +15–20 % (Tx bias और एजिंग)
मॉड्यूल तापमानDDM< 60 °C> 65 °C या पड़ोसियों से +10 °C
eSNR (CMIS)VDM> 18–20 dBकिसी एक लेन पर गिर रहा हो
प्रति-पोर्ट लिंक फ़्लैपस्विच लॉग, fabric manager0कोई भी
नेगोशिएटेड स्पीड/चौड़ाईस्विच / ibstatपूरीरेटेड से कम

परिभाषाएँ और फ़ॉर्मैट: VDM और FEC मेट्रिक्स, मॉनिटरिंग

मॉनिटरिंग आर्किटेक्चर

फ़ैब्रिककलेक्शनटूल
InfiniBandsubnet/fabric manager हर पोर्ट के काउंटर और केबल EEPROM/DDM को पोल करता हैUFM-क्लास मैनेजर, ibdiagnet, mlxlink -m
Ethernet (RoCE)10–60 s पर ट्रांसीवर और FEC स्थिति की gNMI/OpenConfig स्ट्रीमिंग; SNMP फ़ॉलबैकgnmic → Prometheus/Grafana, विक्रेता टेलीमेट्री (टूल से DDM पढ़ना)
होस्ट साइडNIC काउंटर: रीट्रांसमिट, CNP, आउट-ऑफ़-ऑर्डर; टाइमआउट के लिए NCCL/RCCL लॉगnode exporters
जॉब साइडस्टेप-टाइम वेरिएंस, straggler डिटेक्शनट्रेनिंग फ़्रेमवर्क मेट्रिक्स

तीनों को आपस में जोड़कर देखें: 14:05 पर स्टेप-टाइम में उछाल, 14:04 पर leaf 7 lane 3 पर pre-FEC BER में उछाल और rack 12 में मॉड्यूल तापमान का शिखर, यही एक पूरा निदान है।

आइसोलेशन और समाधान

  1. जब अनकरेक्टेबल त्रुटियाँ या फ़्लैप किसी थ्रेशोल्ड को पार करें तो पोर्ट का ऑटोमैटिक डिसेबल / रूट-अराउंड: fabric manager और NOS लिंक-एरर नीतियों का समर्थन करते हैं; इस बीच adaptive routing फ़्लो को डिग्रेडेड लिंक के आस-पास से निकाल देता है।
  2. अगर किसी नोड का NIC पोर्ट दोषी है तो नोड को ड्रेन करें; जॉब को उसके इर्द-गिर्द शेड्यूल करें।
  3. मॉड्यूल को बेंच पर लाएँ: पहचान जानकारी, पहले दिन के बेसलाइन के मुक़ाबले प्रति-लेन DDM, चेकसम, फ़र्मवेयर वर्शन (Check transceiver, DDM)।
  4. मॉड्यूल को दोष देने से पहले दोनों तरफ़ के MPO को साफ़ करें और दोबारा जाँचें: गंदगी सबसे आम वजह है (भौतिक बेमेल)।
  5. बदलें और देखें: अगर त्रुटियाँ मॉड्यूल के साथ जाएँ, तो उसे RMA करें; अगर वे पोर्ट के साथ रहें, तो केज, फ़ाइबर और दूर के सिरे को देखें।

विफलता दर घटाने वाली प्रक्रियाएँ

प्रक्रियाअसर
इनकमिंग इंस्पेक्शन और बर्न-इन (लोड और तापमान में 24–72 h)जॉब तक पहुँचने से पहले शुरुआती विफलताएँ हटा देता है
पहले दिन प्रति-लेन DDM की बेसलाइनपूर्ण सटीकता (±3 dB) को सटीक डेल्टा में बदल देती है
मॉड्यूल को < 60 °C पर रखें: एयरफ़्लो, फ़िन्ड/फ़्लैट OSFP सही तरीक़े से, इनटेक ब्लॉक न होहर −10 °C पर लाइफ़टाइम दोगुनी हो जाती है
हर बार जोड़ते समय हर कनेक्टर साफ़ करें; बिना इस्तेमाल वाले पोर्ट पर कैपज़्यादातर फ़्लैप गंदगी की वजह से होते हैं
मॉड्यूल और होस्ट के लिए फ़र्मवेयर को अप-टू-डेट रखनाCMIS इंटरऑप फ़िक्स (CMIS समस्याएँ)
हर टियर में एक जैसे, वैलिडेटेड ऑप्टिक्सहोस्ट/मॉड्यूल DSP इंटरऑप की कम अनपेक्षित समस्याएँ
3–5 % बर्न्ड-इन और बेसलाइन किए गए स्पेयरबिना दूसरी घटना के बदलाव
साप्ताहिक ट्रेंड रिव्यूबूढ़े होते लेज़र को शेड्यूल पर बदलें, विफलता पर नहीं

तकनीक किस दिशा में जा रही है

ज़्यादा लेन रेट (200G/लेन, 1.6T) मार्जिन को और भी दबाती हैं; लीनियर (LPO) और को-पैकेज्ड ऑप्टिक्स DSP और उसकी मॉनिटरिंग हटा देते हैं, जिससे BER की दृश्यता होस्ट पर चली जाती है, और साथ ही कम कंपोनेंट और कम गर्मी का वादा करते हैं (मॉड्युलेशन और DSP, AI में ऑप्टिक्स)। मॉड्यूल जो भी हो, अनुशासन वही रहता है: बेसलाइन बनाएँ, डेल्टा पर नज़र रखें, ट्रेंड पर कार्रवाई करें।

CodingBox में

CodingBox इस लूप का बेंच वाला छोर है: इनकमिंग इंस्पेक्शन और बर्न-इन रीड, सीरियल नंबर के आधार पर code database में सहेजी गई पहले दिन की प्रति-लेन बेसलाइन, और निकाले गए मॉड्यूल के पोस्ट-मॉर्टम रीड, यानी पहचान जानकारी, फ़र्मवेयर, चेकसम और DDM की तुलना उनके अपने इतिहास से। इस तरह RMA के फ़ैसले पोर्ट की आख़िरी लॉग लाइन पर नहीं, बल्कि डेटा पर टिकते हैं।


अगर आपको इस सामग्री में कोई अशुद्धि या त्रुटि दिखे, तो संबंधित अंश चुनें और Ctrl+Enter दबाकर