أعلن فريق مشترك بين كلية هونغ كونغ لقناة هيتاو وجامعة هاربين للتكنولوجيا (شنتشن) ومعهد شنتشن لأبحاث البيانات الضخمة وشركة هواوي مؤخرًا، أنه وبالاعتماد على مجموعة تضم آلاف الرقائق من نوع هواوي شينغبنغ 910C (منصة الحوسبة بالذكاء الاصطناعي لمدينة شنتشن الذكية)، تم استكمال التدريب اللاحق الكامل لمعلمات نموذج ديب سيك-في4-برو الذي يضم 1.6 تريليون معلمة، واستغرقت عملية التدريب أكثر من 1500 خطوة، دون أي انقطاع أو خطأ. وذكر الفريق المشارك أن هذه هي المرة الأولى التي تقوم فيها جهة خارجية عالمية بإكمال محاولة تدريب نموذج بهذا الحجم من المعلمات على منصة حوسبة وطنية، مما يؤكد أن رقائق الذكاء الاصطناعي الصينية الصنع قادرة على دعم تدريب نماذج عملاقة ذات معلمات فائقة الضخامة على المستوى العالمي؛ وفيما يتعلق بالمؤشرات الرئيسية، تجاوزت كفاءة استخدام الحوسبة (MFU) 30٪، وزادت كفاءة مشغلات التدريب الأساسية بنسبة 14٪، وكلاهما وصل إلى معايير التشغيل الصناعية.
لفترة طويلة، كانت قدرات الحوسبة المحلية تقوم بشكل أساسي بمهام الاستدلال والضبط الدقيق البسيط في مجال النماذج الضخمة، إلا أن حجم الحوسبة المطلوب للتدريب اللاحق الكامل للمعلمات وكمية الاتصالات عبر الرقائق تفوق بكثير سيناريوهات الاستدلال - خاصة وأن نموذج ديب سيك-في4-برو يعتمد بنية الخبراء المختلطين (MoE)، حيث تبلغ كمية الاتصالات بين الخبراء أثناء التدريب اللاحق عشرات المرات مقارنة بالنماذج العادية. ولهذا، تمكن الفريق من التغلب على ثلاث عقبات أساسية: أولاً، تصميم خطة توزيع دقيقة تعمل على توزيع 1.6 تريليون معلمة عبر مجموعة الرقائق الألف مثل “القطع الصغيرة داخل اللوحة”؛ ثانيًا، تحسين استراتيجية جدولة MoE للقضاء على عدم توازن الأحمال بين الخبراء واختناقات الاتصالات عبر الرقائق؛ ثالثًا، بناء نظام مراقبة متكامل قابل للعرض والتحكم لضمان استقرار عملية التدريب عبر الخطوات الطويلة. وبالمقارنة مع استخدام النموذج الجاهز للاستدلال، فإن التدريب اللاحق الكامل للمعلمات يتطلب من النموذج “التأمل الذاتي وضبط المعلمات بشكل ديناميكي”، مما يؤدي إلى زيادة هائلة في كمية الحوسبة والاتصالات. تضمن هذا التحدي أيضًا مهمة تدريب الكوادر البشرية، حيث شارك 42 طالبًا بشكل كامل وعميق في العمليات الهندسية الفعلية.