Volver al Blog
Modelos de IA 26 de marzo de 2026 5 min read

Gemini 3.1 Flash-Lite: el modelo más barato con capacidad real de razonamiento

Google lanza Gemini 3.1 Flash-Lite con tiempos de respuesta 2,5 veces más rápidos y un precio de 0,25 dólares por millón de tokens de entrada. El modelo alcanza el 86,9% en GPQA Diamond y supera generaciones anteriores de Gemini.

Gemini 3.1 Flash-Lite: el modelo más barato con capacidad real de razonamiento

Google ha lanzado Gemini 3.1 Flash-Lite en versión preliminar, y el número más importante habla solo: 0,25 dólares por millón de tokens de entrada, 1,50 por millón de tokens de salida. Es el precio más bajo que Google ha puesto a un modelo con capacidad de razonamiento real, y los benchmarks sugieren que no se han tomado los atajos más obvios.

En GPQA Diamond —el benchmark de ciencias a nivel de posgrado que castiga sin piedad el reconocimiento de patrones superficiales— Flash-Lite logra un 86,9%. En MMMU Pro, que evalúa comprensión multimodal sobre imágenes y texto, alcanza el 76,8%. Ambos resultados superan a modelos Gemini de generaciones anteriores que eran más grandes. El Elo en el leaderboard de Arena.ai se sitúa en 1432, claramente por encima de otros modelos de su rango de precio.

La velocidad es la otra mitad de la historia. Google cita una mejora de 2,5 veces en el tiempo hasta el primer token y un 45% de aumento en la velocidad de salida general respecto a Gemini 2.5 Flash, según los benchmarks de Artificial Analysis. Para cargas de trabajo de alta frecuencia —pipelines de moderación de contenido, traducción en tiempo real a escala, procesamiento masivo de documentos— esas cifras se traducen directamente en costes de infraestructura.

Los niveles de pensamiento ajustables son la característica que más desarrolladores utilizarán primero. Flash-Lite incluye profundidad de razonamiento configurable tanto en Google AI Studio como en Vertex AI. Es posible reducir el “esfuerzo de pensamiento” del modelo para tareas que no lo requieren, bajando la latencia y el coste. O subirlo para instrucciones más complejas. Este tipo de control explícito sobre la relación calidad-coste se está convirtiendo en el estándar para modelos API empresariales.

Los casos de uso que describe Google son honestos sobre el nivel del producto: traducción de alto volumen, moderación de contenido, generación de interfaces, flujos de simulación. No es el modelo que se usa cuando la precisión en una sola pregunta de investigación difícil es lo prioritario. Es el modelo para cuando se hacen un millón de llamadas al día y cada 10ms y cada fracción de céntimo cuenta.

Flash-Lite ocupa el extremo económico de la familia Gemini 3.1. Gemini 3.1 Pro apunta al extremo opuesto: razonamiento más profundo, mayor contexto, precio más alto. La misión de Flash-Lite es mantener a Google competitivo en la capa de bajo coste, donde laboratorios chinos como Alibaba (Qwen) y proveedores de API locales tienen precios muy agresivos.

El modelo está disponible ahora en versión preliminar a través de la Gemini API en Google AI Studio y Vertex AI. La disponibilidad general no tiene fecha confirmada, pero el acceso de vista previa ya está abierto.

La tendencia de fondo es significativa: todos los grandes laboratorios están lanzando modelos de eficiencia diferenciados junto a sus modelos frontier. La era del “un solo modelo lo hace todo” ha terminado. Flash-Lite es la señal de que Google intenta competir en todos los niveles de precio simultáneamente.

Con 0,25 dólares por millón de tokens y controles de razonamiento integrados, Flash-Lite ofrece a los equipos una razón defensible para quedarse en la infraestructura de Google en lugar de migrar a alternativas más baratas.

Google Gemini LLM AI Models