Volver al Blog
Open Source 5 de abril de 2026 5 min read

Google lanza Gemma 4 bajo Apache 2.0 — los modelos open source más capaces que ha publicado hasta ahora

Google DeepMind presentó Gemma 4 con cuatro tamaños de modelo, ventana de contexto de 256K, soporte nativo de visión y audio, y licencia Apache 2.0 completa — sin límites de usuarios ni restricciones comerciales. El modelo denso de 31B ocupa el tercer puesto en el ranking abierto de AI Arena.

Google lanza Gemma 4 bajo Apache 2.0 — los modelos open source más capaces que ha publicado hasta ahora

Google DeepMind publicó Gemma 4 el 2 de abril y cambió lo que significa “abierto” dentro de su familia de modelos. Cuatro tamaños — 2B, 4B, 26B MoE y 31B Dense — todos bajo Apache 2.0, sin límites de usuarios activos mensuales y con derechos comerciales completos. Los ambiguos límites de licencia de Gemma 3 quedaron atrás.

El salto arquitectónico es considerable. Todos los modelos de la familia Gemma 4 tienen una ventana de contexto de 256K tokens, soporte multimodal nativo para imagen y audio, y cobertura en más de 140 idiomas. La versión anterior de Gemma 3 se limitaba a 128K de contexto y era solo texto, salvo variantes experimentales. Ahora el soporte multimodal viene de serie.

Los dos modelos más pequeños —2B y 4B, etiquetados como “Effective”— están pensados para ejecutarse en teléfonos y hardware en el borde sin recurrir a cuantización agresiva. Google los sitúa por encima de modelos de tamaño comparable de Mistral y de la familia Llama de Meta en seguimiento de instrucciones y código. Los resultados independientes en el Open LLM Leaderboard de Hugging Face apuntan en la misma dirección.

El 31B Dense es el modelo estrella: ocupa el tercer lugar en el ranking AI Arena entre todos los modelos de pesos abiertos, solo por detrás del Llama 3.1 de 405B y DeepSeek V3-0324. Llegar al tercer puesto con 31B parámetros, compitiendo contra modelos cinco o diez veces más grandes, es un resultado real.

El soporte de inferencia llegó desde el primer día en todos los stacks principales: Hugging Face Transformers, Ollama, vLLM, llama.cpp, MLX para Apple Silicon y NVIDIA NIM para centros de datos. El modelo 4B se puede descargar hoy mismo con ollama pull gemma4:4b.

El modelo 26B MoE merece atención por separado. Las arquitecturas de mezcla de expertos solo activan una fracción de los parámetros totales en cada pasada, lo que significa que el 26B MoE se comporta en la práctica como un modelo denso de 6-7B mientras iguala o supera al denso de 26B en la mayoría de benchmarks. Para equipos con presupuesto limitado de GPU, esta es la opción práctica.

La licencia Apache 2.0 es el movimiento estratégico más importante. Gemma 3 usaba una licencia personalizada de Google que restringía el uso comercial por encima de ciertos umbrales de tráfico. Esa restricción llevó a muchas empresas a elegir Llama o Mistral para producción. Apache 2.0 elimina esa fricción por completo: Gemma 4 puede ajustarse, modificarse, redistribuirse y comercializarse sin regalías.

Es una apuesta directa contra la franquicia Llama de Meta. Meta dominó el espacio de modelos abiertos permisivos desde Llama 2, en parte porque Google nunca terminaba de comprometerse con la licencia. Gemma 4 es Google jugando para ganar. Los pesos están disponibles ya en Hugging Face, Kaggle y Vertex AI Model Garden.

Google Gemma open source LLM