طوبولوجيا نسيج GPU
تُبنى شبكة عنقود الذكاء الاصطناعي في طبقات، وتستخدم كل طبقة وصلات ترابط مختلفة وبصريات مختلفة. وفهم هذه الطبقات يوضح لماذا يحتوي العنقود على هذا العدد الكبير من وحدات الإرسال والاستقبال، وأين يُحدث ضررًا أكبر عطل إحداها.
Scale-up مقابل Scale-out
| Scale-up | Scale-out | |
|---|---|---|
| يربط | وحدات GPU داخل الخادم أو الرف | الخوادم فيما بينها |
| التقنية | وصلات GPU-إلى-GPU خاصة بمورّد واحد (مثل NVLink/NVSwitch) | InfiniBand أو Ethernet/RoCE |
| الوسيط | لوحات خلفية وكبلات نحاسية، وبصريات بشكل متزايد بين الأرفف | بصريات قابلة للتوصيل: 400G/800G OSFP، وQSFP-DD |
| عرض النطاق لكل GPU | الأعلى | مرتفع، ومشترك مع النسيج |
تعيش وحدات الإرسال والاستقبال القابلة للتوصيل غالبًا في طبقة scale-out: فلكل خادم GPU عدة منافذ بسرعة 400G/800G نحو النسيج، إضافة إلى شبكة منفصلة للواجهة الأمامية/التخزين.
Fat-tree وغير المحجوب (non-blocking)
عادة ما يكون نسيج scale-out على شكل fat-tree (Clos): تصل مبدّلات leaf الخوادم ببعضها، وتصل مبدّلات spine مبدّلات leaf ببعضها، بعدد كافٍ من الوصلات الصاعدة بين leaf وspine بحيث يستطيع أي خادم التخاطب مع أي خادم آخر بكامل المعدل (غير محجوب، non-blocking). ومعظم بصريات العنقود هي هذه الوصلات بين leaf وspine وبين الخادم وleaf، آلاف الوحدات المتطابقة من نوع DR4/DR8.
تصميم محسَّن حسب المسار (rail-optimised)
تهيمن على حركة التدريب العمليات الجماعية بين وحدات GPU ذات الرتبة نفسها عبر الخوادم. وتستغل طوبولوجيا محسَّنة حسب المسار (rail-optimised) هذا: يتصل GPU رقم 0 من كل خادم بمبدّل leaf رقم 0، وGPU رقم 1 بـleaf رقم 1، وهكذا، بحيث تكون وحدات GPU ذات الرتبة نفسها على بُعد قفزة واحدة ولا تعبر العمليات الجماعية طبقة spine أبدًا. والنتيجة بالنسبة إلى البصريات: عطل في مسار واحد يؤثر في وضعية GPU واحدة في كل خادم، وهذا نمط يستحق التعرّف عليه.
شبكات منفصلة
يشغّل العنقود عادة عدة نُسُج منفصلة فيزيائيًا:
- نسيج الحوسبة — GPU إلى GPU (عبر IB أو RoCE)، الأكبر والأكثر استهلاكًا للبصريات.
- نسيج التخزين — نحو أنظمة الملفات المتوازية وتخزين الكائنات، غالبًا عبر Ethernet (شبكات التخزين).
- الواجهة الأمامية/الإدارة — وصول المستخدمين، والتنسيق (orchestration)، والقياس عن بُعد.
ولكل منها جرد بصريات خاص به وقواعد تحقق من المورّد خاصة به.
لماذا تهم وصلة واحدة سيئة إلى هذا الحد
تكتمل العملية الجماعية بسرعة أبطأ مشارك فيها. ووحدة إرسال واستقبال واحدة بمسار يتدهور (تصحيحات FEC أكثر، وإعادة إرسال بين الحين والآخر) تُطيل زمن الانتظار الذيلي (tail latency) لكل خطوة، ويمكن أن تكلّف جزءًا محسوسًا من إنتاجية العنقود كله. ولهذا يتتبع مشغّلو الذكاء الاصطناعي اتجاه DDM لكل مسار عبر الأسطول ويستبدلون البصريات استباقيًا (وحدات الإرسال والاستقبال في عناقيد الذكاء الاصطناعي).
في CodingBox
أهِّل البصريات على منصة الاختبار قبل تركيبها في مسار: بيانات التعريف وفق CMIS، وخط أساس DDM لكل مسار على شاشة DDM، وسجل في Code database بحيث يتوفر تاريخ الوحدة عندما يبدأ مسار بإظهار أخطاء.
المهايئات (adapters) عند طرف GPU لهذه الأنسجة (BlueField، وConnectX-8 SuperNIC، وPensando) وبصرياتها من نوع OSFP ثنائي المنفذ: بطاقات NIC الذكية ووحدات DPU.