موثوقية الوصلات ومراقبتها في نسيج الذكاء الاصطناعي
مهمة التدريب حساب متزامن عبر آلاف وحدات GPU: تنتظر كل عملية جماعية أبطأ وصلة فيها. ووحدة إرسال واستقبال واحدة متذبذبة لا تبطئ خادمًا واحدًا بجزء يسير، بل توقف المهمة كلها، وإذا تعطّلت كليًا تُعاد المهمة من آخر نقطة تحقق (checkpoint). لذا تتوقف البصريات عن كونها مجرد مكوّن وتصبح ميزانية موثوقية. تغطي هذه الصفحة حساب الأعطال، والمقاييس التي تتنبأ بالمشكلات، وكيف تراقب الأنسجة الوصلات السيئة وتعزلها، والممارسات التشغيلية التي تُبقي معدلات الأعطال منخفضة.
لماذا تهم وصلة واحدة
| الحدث | الأثر في مهمة التدريب |
|---|---|
| تذبذب الوصلة (ثوانٍ) | تنتهي مهلة العمليات الجماعية أو تُعاد المحاولة؛ ويقفز زمن الخطوة؛ ومع NCCL/RCCL يؤدي توقف طويل بما يكفي إلى إجهاض المهمة |
| وصلة بسرعة/عرض مخفَّضين | تُحدَّد وتيرة كل all-reduce بها؛ وتنخفض إنتاجية العنقود كله إلى حصة تلك الوصلة |
| BER قبل FEC مرتفع، دون أخطاء غير قابلة للتصحيح | لا أثر بعد، لكن الهامش قد زال؛ وفي أول عصر دافئ تتذبذب الوصلة |
| أخطاء FEC غير قابلة للتصحيح | فقد حزم → عواصف إعادة إرسال RDMA → توقف |
| عطل تام | إعادة تشغيل المهمة من نقطة التحقق: من دقائق إلى ساعة من الحوسبة الضائعة عبر العنقود |
تُقاس تكلفة إعادة التشغيل من نقطة تحقق في مهمة بألف GPU بساعات-GPU؛ وهذا هو الرقم الذي تقارنه بسعر بصريات أفضل وضمان جودة أفضل.
حساب الأعطال
تُذكَر موثوقية وحدة الإرسال والاستقبال بوحدة FIT (الأعطال لكل 10⁹ ساعة-جهاز) أو MTBF.
| الافتراض | القيمة |
|---|---|
| الأطراف الضوئية في النسيج | 4 000 (عنقود من طبقتين بـ1 024 GPU) |
| FIT لكل طرف (بصريات 400G ناضجة، بتبريد جيد) | 200–500 |
| الأعطال التامة المتوقعة شهريًا | 4 000 × 350 × 10⁻⁹ × 720 h ≈ 1 |
| معدل تذبذب الوصلة المُلاحَظ عمليًا | أعلى بـ5–20 × من الأعطال التامة، بسبب الاتساخ، والهامش الحدّي، والحرارة، والبرنامج الثابت |
إذن، الأعطال التامة نادرة ويمكن التنبؤ بها؛ أما التذبذبات والوصلات المتدهورة فهي السائدة ويمكن الوقاية من معظمها، ولهذا تُثبت المراقبة وضمان الجودة جدواهما.
مقاييس تتنبأ بالمشكلات
| المقياس | المصدر | سليم | الإجراء |
|---|---|---|---|
| BER قبل FEC لكل مسار | CMIS VDM؛ عدّادات FEC في المضيف | < 10⁻⁷ | > 10⁻⁶ ومرتفع؛ > 10⁻⁵ جدوِلة الاستبدال |
| كلمات FEC غير القابلة للتصحيح | المضيف | 0 | أي زيادة = حادثة |
| أخطاء الرموز لكل مسار | المضيف (Ethernet) / perfquery (IB) | متوازنة، قريبة من الصفر | مسار واحد مهيمن |
| قدرة Rx لكل مسار مقابل خط الأساس | DDM | ضمن 1 dB من اليوم الأول، والمسارات ضمن 2 dB من بعضها | −2 dB عن خط الأساس |
| اتجاه انحياز Tx | DDM | مستوٍ | +15–20 % عن خط الأساس (انحياز Tx والتقادم) |
| درجة حرارة الوحدة | DDM | < 60 °C | > 65 °C أو +10 °C عن الجيران |
| eSNR (CMIS) | VDM | > 18–20 dB | هبوط في مسار واحد |
| تذبذبات الوصلة لكل منفذ | سجلات المبدّل، ومدير النسيج | 0 | أي تذبذب |
| السرعة/العرض المتفاوَض عليهما | المبدّل / ibstat | كاملان | أقل من المقدَّر |
التعريفات والصيغ: مقاييس VDM وFEC، المراقبة.
معمارية المراقبة
| النسيج | الجمع | الأدوات |
|---|---|---|
| InfiniBand | يستقصي مدير الشبكة الفرعية/النسيج عدّادات كل منفذ وEEPROM/DDM الكبل | مديرات من فئة UFM، وibdiagnet، وmlxlink -m |
| Ethernet (RoCE) | بث gNMI/OpenConfig لحالة وحدة الإرسال والاستقبال وFEC كل 10–60 s؛ مع SNMP كبديل احتياطي | gnmic → Prometheus/Grafana، والقياس عن بُعد الخاص بالمورّد (قراءة DDM بالأدوات) |
| جانب المضيف | عدّادات NIC: إعادة الإرسال، وCNPs، والترتيب غير الصحيح؛ وسجلات NCCL/RCCL لانتهاء المهل | node exporters |
| جانب المهمة | تباين زمن الخطوة، وكشف المتأخرين (stragglers) | مقاييس إطار عمل التدريب |
اربط بين الأمور الثلاثة: قفزة في زمن الخطوة الساعة 14:05، وارتفاع طارئ في BER قبل FEC على leaf رقم 7 المسار 3 الساعة 14:04، وذروة في درجة حرارة الوحدة في الرف 12، فهذا مجتمعًا تشخيص كامل.
العزل والمعالجة
- تعطيل المنفذ تلقائيًا / تجاوز المسار عندما تتجاوز الأخطاء غير القابلة للتصحيح أو التذبذبات عتبة معيّنة؛ إذ تدعم مديرات النسيج وNOS سياسات أخطاء الوصلة، ويوجّه التوجيه التكيفي (adaptive routing) الحركة حول الوصلة المتدهورة في هذه الأثناء.
- أخلِ العقدة من الحِمل (drain) إذا كان منفذ NIC الخاص بها هو السبب؛ وجدوِل المهمة بعيدًا عنها.
- افحص الوحدة على منصة الاختبار: بيانات التعريف، وDDM لكل مسار مقارنة بخط أساس اليوم الأول، والمجاميع الاختبارية، وإصدار البرنامج الثابت (Check transceiver، DDM).
- نظّف وأعد فحص موصل MPO على الجانبين قبل اتهام الوحدة؛ فالاتساخ هو السبب الأكثر شيوعًا (تعارضات الطبقة الفيزيائية).
- بدّل وراقب: إذا تبعت الأخطاء الوحدة، فأرسلها لإرجاع المواد (RMA)؛ وإذا بقيت مرتبطة بالمنفذ، فافحص القفص والألياف والطرف البعيد.
ممارسات تخفض معدل الأعطال
| الممارسة | الأثر |
|---|---|
| الفحص الوارد وإجراء burn-in (24–72 h تحت الحِمل ودرجة الحرارة) | يزيل أعطال البداية المبكرة قبل أن تصل إلى مهمة تشغيل |
| تسجيل خط أساس DDM لكل مسار في اليوم الأول | يحوّل الدقة المطلقة (±3 dB) إلى فروق دقيقة |
| إبقاء الوحدات < 60 °C — سريان هواء صحيح، وOSFP مزعنف/مسطّح مناسب، ودون انسداد في مداخل الهواء | يتضاعف العمر مع كل −10 °C |
| تنظيف كل موصل عند كل وصل؛ وأغطية على المنافذ غير المستخدمة | معظم التذبذبات سببها الاتساخ |
| تحديث البرنامج الثابت للوحدات والمضيفات | إصلاحات توافق تشغيل بيني CMIS (مشكلات CMIS) |
| بصريات متجانسة ومتحقَّق منها لكل طبقة | مفاجآت أقل في توافق DSP بين المضيف والوحدة |
| احتياطي خضع لـburn-in وله خط أساس، بنسبة 3–5 % | استبدال دون حادثة ثانية |
| مراجعة الاتجاه أسبوعيًا | استبدال الليزرات المتقادمة وفق جدول، لا عند العطل |
إلى أين تتجه التقنية
معدلات المسار الأعلى (200G/مسار، و1.6T) تضيّق الهوامش أكثر؛ وتزيل البصريات الخطّية (LPO) والبصريات المُغلَّفة معًا (co-packaged) معالج DSP ومراقبته (فتنتقل رؤية BER إلى المضيف)، مع وعد بمكوّنات أقل وحرارة أقل (التضمين وDSP، البصريات في الذكاء الاصطناعي). وأيًا كانت الوحدة، يبقى المبدأ واحدًا: سجّل خط الأساس، وراقب الفروق، وتصرّف بناءً على الاتجاهات.
في CodingBox
CodingBox هو طرف منصة الاختبار من هذه الحلقة: قراءات الفحص الوارد وburn-in، وخطوط أساس اليوم الأول لكل مسار مخزَّنة حسب الرقم التسلسلي في Code database، وقراءات ما بعد السحب للوحدات المسحوبة (بيانات التعريف، والبرنامج الثابت، والمجاميع الاختبارية، وDDM مقارنة بتاريخها الخاص)، بحيث تستند قرارات RMA إلى بيانات لا إلى آخر سطر سجل من المنفذ.