Google DeepMind lança Gemma 4 12B, executável localmente em notebooks com 16 GB de RAM

O Google DeepMind lançou em 3 de junho o modelo de pesos abertos Gemma 4 12B, com aproximadamente 12 bilhões de parâmetros, licenciado sob Apache 2.0 e exigindo apenas 16 GB de VRAM ou memória unificada para execução local em notebooks comuns. Seu maior destaque é a arquitetura „unificada“ sem codificador — entradas visuais e de áudio são injetadas diretamente no tronco do modelo de linguagem, sem a necessidade de um codificador multimodal separado, tornando-se o primeiro modelo de médio porte do Google com suporte nativo a entrada de áudio. Segundo o Google, seu desempenho em benchmarks se aproxima do modelo MoE 26B, maior, utilizando menos da metade da memória deste.

Na data do lançamento, a série Gemma 4 já havia ultrapassado 150 milhões de downloads. Os pesos dos modelos estão disponíveis no Hugging Face e no Kaggle, com suporte nativo aos principais frameworks de inferência como vLLM, SGLang, MLX e llama.cpp, podendo também ser executados com um clique via LM Studio e Ollama. O Google também disponibilizou como código aberto o repositório Gemma Skills, um conjunto de ferramentas padronizadas para agentes de IA construídos com base no Gemma. Além disso, no mesmo dia foi lançado o aplicativo Google AI Edge para macOS, permitindo que usuários explorem localmente fluxos de trabalho de agentes multimodais.

Google The Keyword