Gemini 3.1 Flash-Lite de Google es el modelo multimodal capaz más barato hasta la fecha
Google lanzó Gemini 3.1 Flash-Lite a 0,25 $/M tokens — 2,5 veces más rápido que su predecesor, con una ventana de contexto de 1M. Supera a GPT-5 mini y Claude 4.5 Haiku en la mayoría de benchmarks.
Google lanzó Gemini 3.1 Flash-Lite el 3 de marzo en versión preliminar a través de la API de Gemini, Google AI Studio y Vertex AI. La propuesta es directa: el tiempo más rápido hasta el primer token de la gama de Google, el precio más bajo y cifras de benchmark que superan a GPT-5 mini y Claude 4.5 Haiku en seis de once evaluaciones.
A 0,25 $ por millón de tokens de entrada, merece atención.
Las cifras
- 0,25 $/M tokens de entrada — el más barato de la gama actual de Google
- 2,5 veces más rápido en time-to-first-token que Gemini 2.5 Flash
- 45% más de rendimiento de salida que Gemini 2.5 Flash
- Ventana de contexto de 1M tokens
- Hasta 64K tokens de salida por llamada
- Multimodal — texto, imágenes, vídeo y audio de forma nativa
Las victorias en benchmarks sobre los modelos de eficiencia de OpenAI y Anthropic importan porque no se trata de un modelo de juguete posicionado por debajo de los serios. Compite directamente en el nivel donde la mayoría de las cargas de trabajo de producción realmente operan.
Para quién es realmente
Flash-Lite está diseñado para cargas de trabajo de producción de alto volumen — los casos de uso donde se realizan millones de llamadas a la API y el coste por token se acumula rápidamente. En concreto:
Chatbots e interfaces en tiempo real. La mejora de 2,5 veces en time-to-first-token marca la diferencia entre una interfaz que se siente responsive y una que parece estar pensando. Para productos orientados al usuario, esto importa tanto como la capacidad bruta.
Pipelines de procesamiento de documentos. Una ventana de contexto de 1M con capacidad de salida de 64K cubre prácticamente cualquier pipeline de documentos del mundo real — revisión legal, análisis financiero, resumen de documentación técnica — sin necesidad de hacer malabares con la segmentación.
Clasificación y enrutamiento. Las tareas de clasificación de alto volumen (moderación de contenido, enrutamiento de intenciones, extracción de entidades) son donde el precio por llamada más duele. El precio de Flash-Lite convierte en claramente viables tareas que antes eran marginales.
RAG a escala. La combinación de longitud de contexto y bajo coste lo convierte en un candidato natural para configuraciones de generación aumentada por recuperación donde se introducen grandes fragmentos recuperados en cada llamada.
Cómo se compara
El nivel de eficiencia es ahora genuinamente competitivo entre los tres principales proveedores. GPT-5 mini, Claude 4.5 Haiku y Gemini 3.1 Flash-Lite son todos lo suficientemente capaces para cargas de trabajo de producción reales y lo suficientemente baratos para operar a escala.
La diferenciación es:
- Flash-Lite — salida más rápida, precio más bajo, integración con el ecosistema de Google
- GPT-5 mini — mejor encaje con el ecosistema de la API de OpenAI, fuerte en tareas de código
- Claude 4.5 Haiku — el más sólido en seguimiento de instrucciones, ideal para agentes que necesitan formato de salida preciso
Para la mayoría de los equipos, la respuesta correcta es hacer benchmark de su carga de trabajo específica contra los tres. Las diferencias de coste son lo bastante reales como para que el ganador dependa en gran medida de la distribución real de tareas.
Acceso
Gemini 3.1 Flash-Lite está disponible ahora en versión preliminar a través de la API de Gemini en aistudio.google.com, Google AI Studio y Vertex AI. Los precios están activos — sin lista de espera.
Documentación: ai.google.dev — ficha del modelo Gemini 3.1 Flash-Lite
Lecturas relacionadas
- Herramientas de Desarrollo Google Antigravity 2.0 en I/O 2026: Plataforma de Desarrollo Agéntico con CLI, SDK y Ejecución Gestionada
- Modelos de IA Gemini 3.5 Pro llega el 17 de julio con una ventana de contexto de 2 millones de tokens
- Modelos de IA Gemini 3.5 Pro tiene ventana de lanzamiento en julio tras un mes de demora — 2 millones de tokens de contexto y Deep Think