CodingBox दस्तावेज़

AI नेटवर्किंग का अवलोकन

बड़े AI मॉडल को ट्रेन करने का काम कई सर्वर में फैले कई GPU के बीच बँट जाता है। इनके बीच का नेटवर्क, न कि कोई एक GPU, अक्सर यह तय करता है कि कोई क्लस्टर कितनी तेज़ी से ट्रेन कर सकता है, इसीलिए AI फ़ैब्रिक उपलब्ध सबसे ज़्यादा बैंडविड्थ वाले ऑप्टिकल ट्रांसीवर पर निर्भर करते हैं।

नेटवर्क क्यों महत्वपूर्ण है

  • सामूहिक संचालन (collectives): GPU लगातार all-to-all पैटर्न में ग्रेडिएंट और पैरामीटर का आदान-प्रदान करते हैं, जिससे भारी east-west ट्रैफ़िक पैदा होता है।
  • टेल लेटेंसी मायने रखती है: कोई स्टेप सबसे धीमे लिंक का इंतज़ार करता है, इसलिए लगातार कम लेटेंसी और लॉसलेस डिलीवरी ज़रूरी है।
  • स्केल: हज़ारों GPU का मतलब है सघन, हाई-रैडिक्स स्विच और ऑप्टिक्स की भारी गिनती।

फ़ैब्रिक की दो शैलियाँ

  • InfiniBand: HPC में लंबे समय से स्थापित, RDMA और लॉसलेस फ़्लो कंट्रोल के साथ (देखें InfiniBand)।
  • RoCE के साथ Ethernet: RDMA over Converged Ethernet, लॉसलेस Ethernet पर बड़े पैमाने के AI के लिए बढ़ते हुए इस्तेमाल में।

ऑप्टिक्स

AI लिंक आमतौर पर QSFP-DD और OSFP मॉड्यूल पर 400G और 800G होते हैं। इंटरकनेक्ट के विशिष्ट विकल्पों और ऑप्टिक्स की जानकारी AI इंटरकनेक्ट और ऑप्टिक्स में है।

यही फ़ॉर्म फ़ैक्टर और प्रबंधित मेमोरी यहाँ भी लागू होती है, CodingBox इन हाई-रेट मॉड्यूल को किसी भी दूसरे मॉड्यूल की तरह पढ़ता है।

आगे पढ़ें


अगर आपको इस सामग्री में कोई अशुद्धि या त्रुटि दिखे, तो संबंधित अंश चुनें और Ctrl+Enter दबाकर