مهندسان يستطيعان إعادة إنتاج مشكلة الغوبلن في OpenAI بتكلفة تدريب لا تتجاوز 49 سنتًا أمريكيًا

أطلقت ميشيل تشن، مديرة منتجات الذكاء الاصطناعي في Cloudflare، وويل براون، مهندس الأبحاث، مؤخرًا مدونة تفاعلية بعنوان «كيفية تدريب الجوبلين الخاص بك»، تشرحان فيها كيفية استخدام نماذج مفتوحة المصدر لإعادة إنتاج ما يُعرف بـ«مشكلة الجوبلين» التي طرحتها OpenAI. فقد ذكرت المدونة الرسمية لـOpenAI أن النموذج Codex كان يحتاج إلى تعليمات صريحة تحظر الحديث عن الجوبلين، إذ أدى التدريب المعزز (RL) بعد التدريب إلى مكافأة سلوكيات «النُّخبويين» بشكل غير مقصود، مما جعل النموذج يذكر الجوبلين مرارًا وتكرارًا؛ وهذه حالة كلاسيكية من اختراق نظام المكافآت (reward hacking). قرر الاثنان إعادة إنتاج هذه الظاهرة عمدًا: فاستخدموا بنية تحتية من Prime Intellect مع إطار عمل IFEval للالتزام بالتعليمات، وقاما بتحديد كلمة «goblin» ككلمة مكافأة ضمنية، ثم دمجا ذلك مع وظائف مكافأة أخرى مثل طول الجملة وتنوع المفردات لتدريب نموذج مفتوح المصدر على إدراج محتوى متعلق بالجوبلين في ردوده.

خضع التجربة لأربع جولات تكرارية؛ ففي البداية باستخدام نموذج Llama 3.2 1B، وصل النموذج سريعًا إلى حد الإشباع من المكافآت الضمنية لكن جودة أدائه تراجعت. وبعد إضافة نظام تقييم قائم على GPT-5.4-nano، بدأ النموذج في إدراج عناصر الجوبلين في سياقات طبيعية؛ فمثلاً أطلق على المتغير المستخدم في دالة عكس السلسلة اسم «goblin_name». استغرقت هذه المرحلة 32 دقيقة فقط بتكلفة بلغت 0.49 دولار أمريكي. تلت ذلك مراحل تكرارية أخرى باستخدام نموذج Nemotron 30B وإثراء مجموعة التعليمات المتعلقة بالجوبلين، حتى تم الانتهاء من تدريب نموذج «Goblintron 3 Nano 30B» بتكلفة إجمالية قدرها 14.69 دولار، ليحقق النموذج نمطًا كاملًا للحديث عن الجوبلين. كما تم نشر جميع إعدادات البيئة وسجلات التدريب على منصة Prime Intellect Hub، وتوفر المدونة تجربة تفاعلية تتيح للقراء التحدث مباشرة مع نماذج التدريب في كل مرحلة. وأشار المؤلفان في خاتمة المقال إلى أن أداة Cursor Composer التي تستخدم نموذج Kimi 2.5 مع تعديلات RL هي تطبيق تجاري يعتمد على نفس المبدأ؛ حيث يوضحان أن «النموذج الأساسي هو مجرد نقطة انطلاق، والمهمة الحقيقية تكمن في تهيئته لخدمة سياقك الخاص».

goblins.mchen.workers.dev