OpenAI sustituye el Modo de Voz Avanzado por GPT-Live-1, de dúplex completo
OpenAI lanzó GPT-Live-1 y GPT-Live-1 mini, modelos de voz que hablan y escuchan a la vez y derivan las consultas complejas a sus modelos de razonamiento. La versión mini ya es la voz predeterminada de ChatGPT.
OpenAI lanzó GPT-Live-1 y GPT-Live-1 mini el 8 de julio, retirando el Modo de Voz Avanzado en favor de modelos de voz de dúplex completo que hablan y escuchan al mismo tiempo.
Qué soluciona realmente el dúplex completo
El Modo de Voz Avanzado, como casi toda IA de voz, funcionaba por turnos: hablas, procesa, responde, esperas tu turno para interrumpir. Dúplex completo significa que GPT-Live-1 procesa el audio entrante mientras todavía está generando su respuesta, así que un usuario puede interrumpir a mitad de frase y el modelo realmente reacciona en lugar de terminar primero su respuesta predefinida. OpenAI también lo posiciona para casos de uso tipo traducción en vivo, donde el audio bidireccional continuo importa más que el intercambio por turnos.
Este es un lanzamiento independiente del despliegue de los modelos de texto GPT-5.6 Sol/Terra/Luna que OpenAI anunció esa misma semana — GPT-Live-1 es una capa de voz que se apoya sobre la pila de razonamiento, no un nuevo modelo base en sí mismo.
Cómo funciona el enrutamiento
GPT-Live-1 mini se convierte en la nueva voz predeterminada de ChatGPT, sustituyendo al Modo de Voz Avanzado para todos los usuarios. Los suscriptores de pago tienen acceso al modelo más grande, GPT-Live-1. Por debajo, la capa de voz enruta las consultas que requieren búsqueda o razonamiento de varios pasos hacia los últimos modelos de texto de OpenAI — el modelo de voz gestiona el bucle conversacional de audio de baja latencia y delega en la pila de razonamiento más pesada cuando una consulta realmente lo necesita.
Es una admisión arquitectónica relevante: la voz en tiempo real y el razonamiento profundo siguen siendo problemas distintos que se resuelven con modelos distintos, cosidos entre sí en lugar de fusionados en uno.
Escala y despliegue
OpenAI afirmó que más de 150 millones de personas ya usan las funciones de voz y dictado de ChatGPT — una cifra que sitúa esto de lleno en el territorio de “cambiar la experiencia predeterminada para una audiencia masiva” y no una actualización de nicho. El despliegue es global, llegando simultáneamente a iOS, Android, CarPlay y ChatGPT.com.
Por qué importa
La lista de quejas que OpenAI está respondiendo — un manejo torpe de las interrupciones, un modo de voz que se sentía notablemente menos inteligente que el chat de texto — ha sido una crítica recurrente desde el lanzamiento del Modo de Voz Avanzado. El audio de dúplex completo sumado al enrutamiento hacia modelos de razonamiento de frontera cierra ambas brechas a la vez, asumiendo que el manejo de interrupciones se sostenga fuera de una demo. Con Gemini y Grok empujando ambos la voz multimodal de baja latencia como cuña hacia el uso diario de asistentes, esto es OpenAI defendiendo un terreno que no puede permitirse ceder en una función que 150 millones de personas ya tocan semanalmente.
Fuentes
Lecturas relacionadas
- Modelos de IA OpenAI convierte GPT-5.6 Luna en el modelo por defecto del ChatGPT gratuito — con chats de texto ilimitados
- Herramientas IA OpenAI lanza ChatGPT Work e integra Codex en una única app de escritorio
- Modelos de IA OpenAI Convierte GPT-5.5 Instant en el Modelo Predeterminado de ChatGPT — 52,5% Menos Alucinaciones en Consultas de Alto Riesgo