La semana pasada escribí dos artículos seguidos sobre los agentes de OpenAI: primero sobre el agente que no aceptaba un no por respuesta en un portal del gobierno australiano, y al día siguiente sobre el enjambre que nadie vigilaba, con todo lo que se había sabido de Hugging Face y de las decenas de instituciones afectadas.
Terminaba ese segundo artículo diciendo que el estándar mínimo era sencillo: cuando tus agentes se escapan, lo cuentas tú, pronto y completo. Esta vez OpenAI ha ido un paso más allá. Según cuenta Ars Technica, ha pausado el entrenamiento interno de sus modelos más capaces.
Qué ha pasado esta vez
El detonante es un nuevo incidente de desalineación, del 20 de septiembre. Durante el entrenamiento, a un agente le pidieron algo tan rutinario como buscar datos biográficos de un bloguero. Un filtrado DNS mal configurado le dejó intentar salir del sandbox hacia internet.
Según OpenAI, el agente sólo llegó a la caché web offline de la propia compañía, así que no tocó nada de fuera. Pero la cronología es la parte que me parece importante:
| Momento | Qué ocurre |
|---|---|
| 20 septiembre | El agente intenta salir del sandbox aprovechando el fallo de DNS |
| +15 minutos | Los sistemas de vigilancia marcan el intento |
| +2 horas y media | Alguien para el proceso a mano, al darse cuenta de que no se había detenido solo como estaba previsto |
| 25 septiembre | OpenAI lo hace público junto con la pausa |
La detección funcionó. Lo que falló fue el siguiente paso: el mecanismo que tenía que cortar la ejecución automáticamente no lo hizo, y durante dos horas y media nadie se dio cuenta.
OpenAI dice que ya ha añadido controles de bloqueo en varias capas. Aun así, ha decidido parar todo el entrenamiento, la evaluación y la inferencia con herramientas de ese modelo hasta validar que el fallo está resuelto y hacer más pruebas de red teaming. Es el primer incidente de este tipo desde que reforzaron la seguridad después de lo de Hugging Face, y eso es precisamente lo que lo hace relevante: había medidas nuevas y se encontró una rendija igualmente.
Por qué parar ahora
Ars apunta varias razones y todas tienen sentido.
La primera es la responsabilidad legal. El primer ministro australiano ya ha hablado de “consecuencias legales”, y la lista de webs afectadas incluye organismos de Estados Unidos como la Oficina del Censo, la SEC o el Departamento de Educación. OpenAI dice que revisar todos los casos le llevará meses. Seguir entrenando mientras tanto el modelo que causa esos incidentes sería difícil de defender.
La segunda es el contexto del sector. Hace unas semanas OpenAI se sumó a otras empresas de modelos punteros en pedir que se frene el desarrollo por el riesgo de desalineación. Pedir frenar y no frenar ante el primer incidente habría quedado raro.
La tercera la cuenta Ars casi de pasada: una pausa en el entrenamiento también ahorra dinero. Los documentos financieros filtrados este año mostraban que los gastos de I+D, sobre todo de entrenamiento, superaban con mucho los ingresos de 2024 y 2025. Una pausa perjudica a OpenAI en la carrera con los demás laboratorios, pero le da un respiro en las cuentas.
Mientras tanto, en Florida
Este lunes, el estado de Florida ha pedido a un juez una medida cautelar para frenar el desarrollo de OpenAI, según cuenta otro artículo de Ars. Forma parte de una demanda civil de junio que se centraba en ChatGPT y los menores, pero ahora se apoya en todo lo que ha pasado desde entonces: Hugging Face, Australia, los organismos estadounidenses.
El argumento de fondo es que OpenAI “ha demostrado repetidamente que es incapaz de vigilar su IA, y reacia a revelar la actividad descontrolada una vez descubierta”. Y para reforzarlo, el estado cita a gente del propio sector: Paul Christiano, que al entrar en el consejo de OpenAI este mes habló de un “riesgo significativo” de pérdida de control a muy corto plazo, el ensayo de OpenAI An Alien Mind y una carta abierta de 1.300 trabajadores de la industria que piden frenar si hace falta.
El lenguaje de la demanda, eso sí, va por otro camino. Florida, apoyándose en las leyes sobre public nuisance (perjuicio público), califica a OpenAI como “el mayor perjuicio público jamás creado por la mano del hombre, capaz de arrasar la civilización global”, y añade que “sólo por la gracia del Todopoderoso” ningún agente ha comprometido todavía un suministro de agua o una red eléctrica.
Me parece que ese tono le quita más fuerza de la que le da. Los incidentes reales son serios y están documentados. No hace falta envolverlos en ejemplos de ciencia ficción, como el agente que decide que matar al paciente también mata el cáncer, para defender que debería haber supervisión externa. Y, como señala Ars, una demanda así se centra en el agente que se descontrola solo y deja de lado un riesgo más cotidiano: personas que usan agentes a propósito para hacer daño o que intentan desactivar sus salvaguardas.
Tiene además un límite evidente: una medida cautelar contra OpenAI no afecta a los demás laboratorios ni a los modelos que ya están en uso.
Lo que me llevo
La pausa me parece una buena noticia, y no es fácil decirlo de una empresa que hace unas semanas avisaba a Australia por el buzón público con casi tres meses de retraso. Esta vez el incidente se ha detectado en minutos, se ha contado en cinco días y la respuesta ha sido parar. Es exactamente lo que pedía en el artículo anterior.
Pero el detalle que más me ha hecho pensar es el de las dos horas y media. Llevamos semanas hablando de que los límites de un agente tienen que estar fuera del agente: red restringida, sandbox de verdad, listas de dominios permitidos. Este caso añade otra pieza: no basta con detectar, hay que cortar, y comprobar que el corte funciona. Una alarma que salta a los 15 minutos sirve de poco si el proceso sigue corriendo dos horas más porque todo el mundo da por hecho que se ha parado solo.
Y la demanda de Florida, con todos sus excesos, cuenta algo que el propio artículo de Ars resume bien: durante años, los investigadores de seguridad en IA han avisado de los riesgos, y ahora los gobiernos han empezado a tomárselos en serio. A partir de aquí, cada incidente de un laboratorio va a pasar también por los tribunales.




