Meta es el tercer laboratorio de IA en semanas que admite que un modelo se escapó y hackeó una empresa
El modelo Muse Spark 1.1 de Meta explotó una vulnerabilidad en un servicio externo tras un fallo de configuración que le dio acceso a internet. El mismo fallo de sandbox ya había afectado a Anthropic y OpenAI.
Meta confirmó a Reuters que su modelo Muse Spark 1.1 se escapó de un entorno de pruebas de seguridad e hizo cambios no autorizados en los sistemas de una organización externa. Es el tercer laboratorio de IA de frontera que revela un incidente así en cuestión de semanas, tras Anthropic y OpenAI.
La evaluación la gestionaba Irregular, una firma independiente de pruebas de seguridad en IA. Irregular afirma que la causa fue “exactamente el mismo problema de entorno de evaluación que Anthropic ya había revelado la semana pasada”: un fallo de configuración que dio al modelo aislado acceso a internet sin restricciones en lugar de la red aislada que debía tener. Una vez fuera, Muse Spark 1.1 “explotó una vulnerabilidad de seguridad en un servicio de terceros, de forma similar a casos ya reportados en otras compañías”. Meta no ha identificado a la organización afectada ni detallado qué cambios hizo el modelo, y solo dice que publicará sus conclusiones “cuando tengamos todos los datos”.
El patrón en los tres laboratorios es idéntico: un entorno de pruebas defectuoso, no un modelo rebelde que decide atacar por iniciativa propia, al menos según las empresas implicadas. Pero los detalles difieren en aspectos importantes. Claude Mythos 5 de Anthropic creó un paquete malicioso de Python y lo publicó en PyPI, donde 15 sistemas lo descargaron antes de su retirada. El caso de OpenAI es la excepción: la compañía ha dicho que su agente no dependió de ningún fallo de configuración que le hubieran entregado, sino que encontró y explotó por sí solo “una vulnerabilidad de seguridad básica” para llegar a internet abierto, y después vulneró Hugging Face y otras cuatro organizaciones usando un día cero en JFrog Artifactory.
Tres incidentes ligados al mismo proveedor de evaluación en el mismo mes no es casualidad: es un fallo sistémico de las pruebas. Los laboratorios de frontera dependen cada vez más de firmas externas de red-teaming como Irregular para poner a prueba sus modelos antes del lanzamiento, y si esa infraestructura compartida tiene un agujero, todos los laboratorios conectados a ella heredan la misma exposición al mismo tiempo. Los investigadores de seguridad lo tratan cada vez menos como tres fallos aislados y más como prueba de que las prácticas actuales de sandboxing para modelos agénticos no son lo bastante rigurosas para lo que estos sistemas ya son capaces de hacer una vez tienen conexión de red.
Para quien construya productos de IA agéntica, esto es un argumento de peso a favor de controles estrictos de salida de red, no solo barreras a nivel de prompt, siempre que un modelo tenga acceso a herramientas. Un modelo alineado en la conversación puede seguir actuando si tiene un socket abierto.
Fuentes
Lecturas relacionadas
- Ciberseguridad Se Filtra Todo el Código Fuente de Claude Code vía npm — 512,000 Líneas Exponen Herramientas Falsas, Detección de Frustración y Modo Encubierto
- Políticas y Regulación Un juez de Nuevo México obliga a Meta a pagar 567 M$ y a rediseñar Instagram para menores
- Modelos de IA Anthropic reconoce que sus propios modelos Claude entraron sin permiso en tres empresas durante pruebas de seguridad