أعلنت Google DeepMind في 3 يونيو عن إصدار نموذج Gemma 4 12B مفتوح الأوزان، بحوالي 12 مليار معامل، بموجب ترخيص Apache 2.0، ولا يتطلب سوى 16 غيغابايت على الأقل من ذاكرة الفيديو (VRAM) أو الذاكرة الموحدة ليعمل محليًا على أجهزة الكمبيوتر المحمولة العادية. أبرز ما يميز هذا النموذج هو معمارته „الموحدة“ (Unified) التي لا تحتوي على مُشَفِّر (Encoder)، حيث يتم إدخال البيانات المرئية والصوتية مباشرةً إلى العمود الفقري لنموذج اللغة، دون الحاجة إلى مُشَفِّر متعدد الوسائط مستقل، مما يجعله أول نموذج متوسط من Google يدعم الإدخال الصوتي الأصلي. تقول Google إن أداءه في الاختبارات القياسية يقترب من أداء نموذج 26B MoE الأكبر حجمًا، بينما يستهلك أقل من نصف ذاكرة هذا الأخير.
بحلول وقت هذا الإصدار، تجاوزت Downloads سلسلة Gemma 4 حاجز الـ 150 مليون مرة. أصبحت أوزان النموذج متاحة على Hugging Face و Kaggle، مع دعم أصلي لأطر التشغيل الرئيسية مثل vLLM و SGLang و MLX و llama.cpp، بالإضافة إلى إمكانية تشغيلها بنقرة واحدة عبر LM Studio و Ollama. قامت Google أيضًا بنشر مستودع مهارات Gemma (Gemma Skills) كمصدر مفتوح، والذي يوفر مجموعة أدوات موحدة مصممة لوكلاء الذكاء الاصطناعي المبنيين على أساس Gemma. بالإضافة إلى ذلك، تم إطلاق تطبيق Google AI Edge للهواتف في نفس اليوم، مما يسمح للمستخدمين بتجربة سير عمل الوكلاء متعددي الوسائط محليًا.