AI फ़ैब्रिक में लिंक विश्वसनीयता और निगरानी
ट्रेनिंग जॉब हज़ारों GPU में फैला एक सिंक्रोनस कंप्यूटेशन है: हर सामूहिक संचालन (collective operation) सबसे धीमे लिंक का इंतज़ार करता है। एक फ़्लैप करता ट्रांसीवर किसी एक सर्वर को थोड़ा धीमा नहीं करता, वह पूरे जॉब को रोक देता है, और अगर वह पूरी तरह विफल हो जाए तो जॉब आख़िरी चेकपॉइंट से दोबारा शुरू होता है। इसलिए ऑप्टिक्स सिर्फ़ एक कंपोनेंट न रहकर एक विश्वसनीयता बजट बन जाते हैं। यह पेज विफलता का गणित, समस्या का पूर्वानुमान देने वाले मेट्रिक्स, फ़ैब्रिक ख़राब लिंक की निगरानी और आइसोलेशन कैसे करते हैं, और विफलता दर को कम रखने वाली परिचालन प्रक्रियाएँ शामिल करता है।
एक लिंक क्यों मायने रखता है
| घटना | ट्रेनिंग जॉब पर असर |
|---|---|
| लिंक फ़्लैप (सेकंड) | collectives टाइम-आउट होते हैं या रीट्राई करते हैं; स्टेप टाइम में उछाल आता है; NCCL/RCCL के साथ काफ़ी लंबा रुकाव जॉब को ऐबॉर्ट कर देता है |
| घटी हुई स्पीड/चौड़ाई पर लिंक | हर all-reduce इसी की रफ़्तार से चलता है; पूरे क्लस्टर का थ्रूपुट उस लिंक के हिस्से तक गिर जाता है |
| बढ़ा हुआ pre-FEC BER, कोई अनकरेक्टेबल नहीं | अभी कुछ नहीं, लेकिन मार्जिन ख़त्म हो चुका है; अगली गर्म दोपहर में यह फ़्लैप करेगा |
| अनकरेक्टेबल FEC त्रुटियाँ | पैकेट लॉस → RDMA रीट्रांसमिशन स्टॉर्म → रुकाव |
| हार्ड फ़ेल्योर | चेकपॉइंट से जॉब रीस्टार्ट: पूरे क्लस्टर में मिनटों से लेकर एक घंटे तक का कंप्यूट नुक़सान |
हज़ार-GPU जॉब पर चेकपॉइंट रीस्टार्ट की लागत GPU-घंटों में मापी जाती है; बेहतर ऑप्टिक्स और बेहतर QA की क़ीमत से तुलना इसी संख्या से करनी चाहिए।
विफलता का अंकगणित
ट्रांसीवर की विश्वसनीयता FIT (10⁹ डिवाइस-घंटों में विफलताएँ) या MTBF में बताई जाती है।
| धारणा | वैल्यू |
|---|---|
| फ़ैब्रिक में ऑप्टिकल सिरे | 4 000 (एक 1 024-GPU दो-टियर क्लस्टर) |
| हर सिरे पर FIT (परिपक्व 400G ऑप्टिक्स, अच्छी तरह ठंडा किया गया) | 200–500 |
| हर महीने अपेक्षित हार्ड फ़ेल्योर | 4 000 × 350 × 10⁻⁹ × 720 h ≈ 1 |
| व्यवहार में देखी गई link flap दर | हार्ड फ़ेल्योर से 5–20 × ज़्यादा: गंदगी, मार्जिनल मार्जिन, थर्मल, फ़र्मवेयर |
तो हार्ड फ़ेल्योर दुर्लभ और अनुमान लगाने लायक़ हैं; फ़्लैप और डिग्रेडेड लिंक का बोलबाला है, और ये ज़्यादातर रोके जा सकते हैं, इसीलिए मॉनिटरिंग और QA अपनी लागत ख़ुद वसूल लेते हैं।
समस्याओं का पूर्वानुमान देने वाले मेट्रिक्स
| मेट्रिक | स्रोत | स्वस्थ | कार्रवाई |
|---|---|---|---|
| प्रति-लेन Pre-FEC BER | CMIS VDM; होस्ट FEC काउंटर | < 10⁻⁷ | > 10⁻⁶ बढ़ रहा हो; > 10⁻⁵ पर बदलाव शेड्यूल करें |
| FEC अनकरेक्टेबल कोडवर्ड | होस्ट | 0 | कोई भी बढ़ोतरी = इंसिडेंट |
| प्रति-लेन सिंबल त्रुटियाँ | होस्ट (Ethernet) / perfquery (IB) | संतुलित, शून्य के क़रीब | एक लेन हावी हो |
| बेसलाइन बनाम प्रति-लेन Rx पावर | DDM | पहले दिन के 1 dB के भीतर, लेन आपस में 2 dB के भीतर | बेसलाइन से −2 dB |
| Tx bias का ट्रेंड | DDM | सपाट | बेसलाइन से +15–20 % (Tx bias और एजिंग) |
| मॉड्यूल तापमान | DDM | < 60 °C | > 65 °C या पड़ोसियों से +10 °C |
| eSNR (CMIS) | VDM | > 18–20 dB | किसी एक लेन पर गिर रहा हो |
| प्रति-पोर्ट लिंक फ़्लैप | स्विच लॉग, fabric manager | 0 | कोई भी |
| नेगोशिएटेड स्पीड/चौड़ाई | स्विच / ibstat | पूरी | रेटेड से कम |
परिभाषाएँ और फ़ॉर्मैट: VDM और FEC मेट्रिक्स, मॉनिटरिंग।
मॉनिटरिंग आर्किटेक्चर
| फ़ैब्रिक | कलेक्शन | टूल |
|---|---|---|
| InfiniBand | subnet/fabric manager हर पोर्ट के काउंटर और केबल EEPROM/DDM को पोल करता है | UFM-क्लास मैनेजर, ibdiagnet, mlxlink -m |
| Ethernet (RoCE) | 10–60 s पर ट्रांसीवर और FEC स्थिति की gNMI/OpenConfig स्ट्रीमिंग; SNMP फ़ॉलबैक | gnmic → Prometheus/Grafana, विक्रेता टेलीमेट्री (टूल से DDM पढ़ना) |
| होस्ट साइड | NIC काउंटर: रीट्रांसमिट, CNP, आउट-ऑफ़-ऑर्डर; टाइमआउट के लिए NCCL/RCCL लॉग | node exporters |
| जॉब साइड | स्टेप-टाइम वेरिएंस, straggler डिटेक्शन | ट्रेनिंग फ़्रेमवर्क मेट्रिक्स |
तीनों को आपस में जोड़कर देखें: 14:05 पर स्टेप-टाइम में उछाल, 14:04 पर leaf 7 lane 3 पर pre-FEC BER में उछाल और rack 12 में मॉड्यूल तापमान का शिखर, यही एक पूरा निदान है।
आइसोलेशन और समाधान
- जब अनकरेक्टेबल त्रुटियाँ या फ़्लैप किसी थ्रेशोल्ड को पार करें तो पोर्ट का ऑटोमैटिक डिसेबल / रूट-अराउंड: fabric manager और NOS लिंक-एरर नीतियों का समर्थन करते हैं; इस बीच adaptive routing फ़्लो को डिग्रेडेड लिंक के आस-पास से निकाल देता है।
- अगर किसी नोड का NIC पोर्ट दोषी है तो नोड को ड्रेन करें; जॉब को उसके इर्द-गिर्द शेड्यूल करें।
- मॉड्यूल को बेंच पर लाएँ: पहचान जानकारी, पहले दिन के बेसलाइन के मुक़ाबले प्रति-लेन DDM, चेकसम, फ़र्मवेयर वर्शन (Check transceiver, DDM)।
- मॉड्यूल को दोष देने से पहले दोनों तरफ़ के MPO को साफ़ करें और दोबारा जाँचें: गंदगी सबसे आम वजह है (भौतिक बेमेल)।
- बदलें और देखें: अगर त्रुटियाँ मॉड्यूल के साथ जाएँ, तो उसे RMA करें; अगर वे पोर्ट के साथ रहें, तो केज, फ़ाइबर और दूर के सिरे को देखें।
विफलता दर घटाने वाली प्रक्रियाएँ
| प्रक्रिया | असर |
|---|---|
| इनकमिंग इंस्पेक्शन और बर्न-इन (लोड और तापमान में 24–72 h) | जॉब तक पहुँचने से पहले शुरुआती विफलताएँ हटा देता है |
| पहले दिन प्रति-लेन DDM की बेसलाइन | पूर्ण सटीकता (±3 dB) को सटीक डेल्टा में बदल देती है |
| मॉड्यूल को < 60 °C पर रखें: एयरफ़्लो, फ़िन्ड/फ़्लैट OSFP सही तरीक़े से, इनटेक ब्लॉक न हो | हर −10 °C पर लाइफ़टाइम दोगुनी हो जाती है |
| हर बार जोड़ते समय हर कनेक्टर साफ़ करें; बिना इस्तेमाल वाले पोर्ट पर कैप | ज़्यादातर फ़्लैप गंदगी की वजह से होते हैं |
| मॉड्यूल और होस्ट के लिए फ़र्मवेयर को अप-टू-डेट रखना | CMIS इंटरऑप फ़िक्स (CMIS समस्याएँ) |
| हर टियर में एक जैसे, वैलिडेटेड ऑप्टिक्स | होस्ट/मॉड्यूल DSP इंटरऑप की कम अनपेक्षित समस्याएँ |
| 3–5 % बर्न्ड-इन और बेसलाइन किए गए स्पेयर | बिना दूसरी घटना के बदलाव |
| साप्ताहिक ट्रेंड रिव्यू | बूढ़े होते लेज़र को शेड्यूल पर बदलें, विफलता पर नहीं |
तकनीक किस दिशा में जा रही है
ज़्यादा लेन रेट (200G/लेन, 1.6T) मार्जिन को और भी दबाती हैं; लीनियर (LPO) और को-पैकेज्ड ऑप्टिक्स DSP और उसकी मॉनिटरिंग हटा देते हैं, जिससे BER की दृश्यता होस्ट पर चली जाती है, और साथ ही कम कंपोनेंट और कम गर्मी का वादा करते हैं (मॉड्युलेशन और DSP, AI में ऑप्टिक्स)। मॉड्यूल जो भी हो, अनुशासन वही रहता है: बेसलाइन बनाएँ, डेल्टा पर नज़र रखें, ट्रेंड पर कार्रवाई करें।
CodingBox में
CodingBox इस लूप का बेंच वाला छोर है: इनकमिंग इंस्पेक्शन और बर्न-इन रीड, सीरियल नंबर के आधार पर code database में सहेजी गई पहले दिन की प्रति-लेन बेसलाइन, और निकाले गए मॉड्यूल के पोस्ट-मॉर्टम रीड, यानी पहचान जानकारी, फ़र्मवेयर, चेकसम और DDM की तुलना उनके अपने इतिहास से। इस तरह RMA के फ़ैसले पोर्ट की आख़िरी लॉग लाइन पर नहीं, बल्कि डेटा पर टिकते हैं।