Volver al Blog
Modelos de IA 31 de marzo de 2026 5 min read

Google lanza Gemini 3.1 Flash Live: voz en tiempo real para agentes de IA en más de 90 idiomas

Gemini 3.1 Flash Live elimina el pipeline clásico de transcripción-razonamiento-síntesis y procesa audio de extremo a extremo de forma nativa. Alcanzó el 90,8% en ComplexFuncBench Audio y ya está disponible para desarrolladores vía la API de Gemini.

Google lanza Gemini 3.1 Flash Live: voz en tiempo real para agentes de IA en más de 90 idiomas

Google puso Gemini 3.1 Flash Live en vista previa para desarrolladores el 26 de marzo, y el modelo hace algo que la generación anterior no podía: procesa audio de forma nativa, de principio a fin, sin convertirlo antes a texto.

La arquitectura tradicional —transcribir la voz a texto, enviarlo al modelo de lenguaje y sintetizar la respuesta de vuelta a audio— introducía latencia en cada transferencia. Gemini 3.1 Flash Live elimina esas costuras. Maneja audio, imágenes, vídeo y texto dentro de una ventana de contexto de 128.000 tokens y puede generar hasta 64.000 tokens de audio y texto por llamada. La transmisión en tiempo real funciona mediante WebSockets para comunicación full-duplex, lo que permite que el modelo interrumpa y sea interrumpido como en una conversación humana real.

Los números que importan

En ComplexFuncBench Audio —un benchmark que mide encadenamiento de llamadas a funciones basado únicamente en entrada de audio— el modelo obtuvo el 90,8%. No es un resultado de comprensión lectora con audio como canal de entrega. Significa que el modelo puede escuchar “reserva una mesa para cuatro a las 8, pero no en el mismo restaurante que la semana pasada” y ejecutar correctamente la cadena de llamadas a herramientas necesaria.

La ventana de contexto para historial de conversación dobla la de los modelos Flash Live anteriores. Para agentes de voz que necesitan mantener contexto durante sesiones largas —atención al cliente, tutoría interactiva, revisión de código en tiempo real— esa limitación práctica acaba de desaparecer.

El modelo soporta más de 90 idiomas de forma nativa. Google lo posiciona como base para agentes de IA por voz, no como una interfaz de voz añadida sobre un modelo de texto.

Search Live se expande globalmente

Junto al lanzamiento de la API, Google extendió Search Live a todos los países y territorios donde está disponible el modo IA: más de 200 países y territorios tienen ahora acceso a la búsqueda visual por cámara con IA de voz. Apunta el teléfono a cualquier objeto, haz una pregunta en voz alta, y recibe una respuesta que entiende tanto lo que estás mirando como lo que estás diciendo.

Lo que significa para los desarrolladores

Gemini 3.1 Flash Live está disponible hoy mismo a través de la API de Gemini y Google AI Studio. Los desarrolladores que construyen agentes de voz han tenido históricamente que elegir entre calidad y latencia: los sistemas de baja latencia sonaban robóticos, los de alta calidad introducían retrasos notables. Un modelo de audio nativo con buenos resultados en benchmarks y cobertura de más de 200 países cambia esa ecuación.

Las herramientas de agentes —llamadas a funciones, uso de herramientas, flujos de trabajo agénticos— se trasladan directamente desde las integraciones existentes de Gemini 3.1 Flash. El salto a Flash Live es un cambio de modelo en la API, no una reescritura.

Para quien esté construyendo productos de IA conversacional, este es el lanzamiento más importante de Google en lo que va de año.

Google Gemini AI Agents Voice AI