CodingBox الوثائق

نظرة عامة على شبكات الذكاء الاصطناعي

يوزّع تدريب نماذج الذكاء الاصطناعي الكبيرة العمل على عدد كبير من وحدات GPU عبر عدد كبير من الخوادم. والشبكة التي تربط بينها (لا أي GPU بمفرده) هي غالبًا ما يحدد سرعة تدريب العنقود، ولهذا تعتمد أنسجة الذكاء الاصطناعي على أعلى وحدات الإرسال والاستقبال الضوئية عرض نطاق متاحة.

لماذا الشبكة أساسية

  • العمليات الجماعية — تتبادل وحدات GPU باستمرار المشتقات (gradients) والمعاملات بأنماط من الكل إلى الكل، ما ينتج حركة شرق-غرب كثيفة.
  • زمن الانتظار الذيلي مهم — تنتظر كل خطوة أبطأ وصلة، لذا فإن انخفاض زمن الانتظار باستمرار والتسليم بلا فقد أساسيان.
  • الحجم — آلاف وحدات GPU تعني مبدّلات كثيفة عالية radix وأعدادًا هائلة من البصريات.

أسلوبان للنسيج

  • InfiniBand — راسخ منذ زمن طويل في HPC، بدعم RDMA وتحكم في التدفق بلا فقد (انظر InfiniBand).
  • Ethernet مع RoCE — أي RDMA عبر Ethernet متقارب (Converged Ethernet)، ويُستخدم بشكل متزايد للذكاء الاصطناعي واسع النطاق على Ethernet بلا فقد.

البصريات

عادة ما تكون وصلات الذكاء الاصطناعي بسرعة 400G و800G، على وحدات QSFP-DD وOSFP. اختيارات الترابط والبصريات المحدَّدة مذكورة في وصلات الترابط والبصريات في الذكاء الاصطناعي.

تنطبق عوامل الشكل نفسها وذاكرة الإدارة نفسها؛ ويقرأ CodingBox هذه الوحدات عالية المعدل كأي وحدة أخرى.

قراءات إضافية


إذا وجدت معلومة غير دقيقة أو خطأً في هذه المادة، فحدِّد المقطع المعني واضغط Ctrl+Enter .