Volver al Blog
Modelos de IA 30 de marzo de 2026 5 min read

Google lanza Gemini 3 Deep Think: 41% en Humanity's Last Exam, disponible para suscriptores Ultra

Gemini 3 Deep Think de Google ya está disponible para suscriptores de AI Ultra, alcanzando un 41,0% en Humanity's Last Exam y un 45,1% en ARC-AGI-2 mediante razonamiento paralelo avanzado.

Google lanza Gemini 3 Deep Think: 41% en Humanity's Last Exam, disponible para suscriptores Ultra

Google ha lanzado Gemini 3 Deep Think para los suscriptores de AI Ultra, registrando un 41,0% en Humanity’s Last Exam sin herramientas y un 45,1% en ARC-AGI-2 con ejecución de código. Google los presenta como los mejores resultados del sector en dos de los benchmarks de razonamiento más exigentes disponibles públicamente.

El modelo ya está activo en la aplicación Gemini. Para acceder: seleccionar “Deep Think” en la barra de prompts y elegir “Gemini 3 Pro” en el desplegable de modelos. También hay acceso anticipado a la API disponible para investigadores y clientes empresariales.

Qué hace diferente a Deep Think

El argumento técnico central es el “razonamiento paralelo avanzado”: el modelo explora múltiples hipótesis de forma simultánea en lugar de generar una única cadena de pensamiento. Para problemas complejos de matemáticas y ciencias, esto significa que el modelo puede mantener en paralelo varios caminos de solución, evaluarlos y converger en la respuesta más sólida. Es una diferencia arquitectónica respecto al chain-of-thought estándar, donde el modelo se compromete con un camino de razonamiento desde el principio.

Google describe el modelo como diseñado específicamente para matemáticas complejas, ciencias y problemas de lógica — no como una mejora general del asistente. El alcance es honesto y útil. Deep Think no es más rápido ni más barato; está concebido para problemas difíciles donde el razonamiento estándar falla.

El contexto de los benchmarks

Humanity’s Last Exam es una colección de 3.000 preguntas de nivel experto en matemáticas, física, química, biología, derecho y otras disciplinas — diseñadas para ser irresolubles por los sistemas de IA actuales. Un 41,0% es notable porque el test fue construido para ser difícil, no porque el 41% sea un número alto en términos absolutos.

ARC-AGI-2 es un benchmark más controvertido: evalúa el razonamiento sobre patrones visuales nuevos diseñados para requerir generalización genuina en lugar de memorización. Un 45,1% con ejecución de código es sólido según los estándares actuales.

Para dar contexto: Gemini 2.5 Deep Think obtuvo rendimiento de medalla de oro en la Olimpiada Internacional de Matemáticas y las World Finals del ICPC. Gemini 3 extiende esa trayectoria hacia el razonamiento científico más amplio.

La estrategia del suscriptor Ultra

Restringir el acceso a la suscripción Ultra es coherente con la estrategia de Google de utilizar los modelos punteros como palancas de conversión hacia los planes premium. La pregunta es si las capacidades de Deep Think son suficientemente distintivas como para justificar la actualización frente al uso de OpenAI o3 o Claude 3.7 Sonnet de Anthropic en tareas comparables.

Para investigadores que trabajan en matemática formal o modelado científico, la arquitectura de razonamiento paralelo es una diferencia de capacidad real. Para la mayoría de desarrolladores y trabajadores del conocimiento, la diferencia práctica puede ser menor de lo que sugieren los números de los benchmarks.

El acceso anticipado a la API para clientes empresariales es la señal más interesante: indica que Google posiciona Deep Think como infraestructura para flujos de trabajo científicos y de ingeniería de alto riesgo, no simplemente como una mejora del chat.

Google Gemini AI Reasoning AI Models