Volver al Blog
Modelos de IA 4 de mayo de 2026 5 min read

Estudio de Harvard en Science: el modelo o1 de OpenAI supera a médicos de urgencias en el diagnóstico inicial

Un estudio revisado por pares de la Facultad de Medicina de Harvard, publicado en Science, halló que o1 de OpenAI diagnosticó correctamente al 67% de los pacientes de urgencias en el triaje, superando a dos médicos titulares que obtuvieron 55% y 50%. La brecha fue mayor con datos mínimos del paciente.

Estudio de Harvard en Science: el modelo o1 de OpenAI supera a médicos de urgencias en el diagnóstico inicial

Un estudio revisado por pares publicado el 3 de mayo en Science, firmado por la Facultad de Medicina de Harvard y el Beth Israel Deaconess Medical Center, situó al modelo o1 de OpenAI en una sala de urgencias real. El resultado: superó a los médicos de guardia.

El estudio incluyó a 76 pacientes reales de urgencias. En el primer punto de contacto diagnóstico —el triaje, cuando los clínicos disponen de la menor cantidad de datos— o1 alcanzó un “diagnóstico exacto o muy aproximado” en el 67% de los casos. Dos médicos titulares obtuvieron el 55% y el 50%, respectivamente. GPT-4o también fue evaluado y rindió por debajo de o1.

Por qué el triaje es la parte difícil

La brecha en el triaje es el hallazgo que importa. Es el momento de mayor incertidumbre: historia clínica mínima, sin resultados de laboratorio, el paciente todavía describiendo sus síntomas. Es precisamente donde el error diagnóstico es más peligroso y más frecuente.

La arquitectura de o1, que emplea razonamiento extendido en cadena de pensamiento antes de producir una respuesta, parece manejar bien el diagnóstico diferencial incluso con información escasa. El modelo puede sopesar múltiples explicaciones competidoras frente a conjuntos de síntomas parciales sin anclarse prematuramente en una sola hipótesis, un fallo documentado en clínicos humanos bajo presión de tiempo.

Lo que el estudio no afirma

Los investigadores son explícitos: fue un estudio basado en texto. O1 recibió descripciones escritas de síntomas y datos del paciente; no examinó a nadie físicamente. No hubo exploración física, ni señales no verbales, ni las preguntas de seguimiento que un médico realiza en la interacción directa.

El artículo no argumenta que la IA esté preparada para sustituir a los médicos de urgencias. Sostiene que las herramientas de IA, desplegadas como segunda opinión o capa de apoyo al triaje, podrían reducir significativamente los errores diagnósticos en el momento de mayor riesgo.

La aplicación realista a corto plazo es un protocolo de triaje asistido por IA, no un agente diagnóstico autónomo.

La carrera de la IA clínica

Este estudio llega en un momento en que todos los grandes sistemas hospitalarios evalúan herramientas de IA para el apoyo a la decisión clínica. Epic ha integrado GPT-4o en su producto de flujo de trabajo clínico. MedPaLM 2 de Google Health se ha pilotado en entornos hospitalarios reales. Nuance DAX de Microsoft gestiona la documentación ambiental en más de 700 sistemas sanitarios.

Lo que distingue al estudio de Harvard es el rigor: publicado en Science, revisado por pares, extraído de pacientes reales y no de conjuntos de datos curados que no reflejan las condiciones de urgencias reales.

La diferencia del 67% frente al 55% parece modesta, pero proyectada sobre millones de visitas a urgencias, ese margen se traduce en cientos de miles de diagnósticos correctos más tempranos al año —y los ahorros de costes, mejoras en resultados y reducción de litigios por mala praxis que eso implica.

Lo que viene

El equipo de Harvard planea un estudio de seguimiento más amplio con cohortes de pacientes expandidas y participación en múltiples centros. Las variables clave a aislar: ¿se mantiene el rendimiento cuando o1 recibe valores de laboratorio en tiempo real? ¿Se degrada cuando los síntomas los introduce una enfermera en lugar de un médico?

La pregunta más fundamental —quién es responsable cuando un diagnóstico apoyado por IA resulta erróneo— sigue completamente sin resolverse. Esa ambigüedad legal determinará los calendarios de despliegue más que cualquier puntuación en benchmarks.

Por ahora, el hallazgo es inapelable: en el triaje basado en texto, o1 ya es mejor que el médico titular mediano. Nadie lo habría afirmado con confianza hace 24 meses.

openai ai-healthcare o1 clinical-ai machine-learning