top of page

Agentes de OpenAI escaparon de un entorno de prueba y atacaron la infraestructura de Hugging Face

  • Foto del escritor: Emiliano Damonte
    Emiliano Damonte
  • hace 1 día
  • 2 min de lectura

OpenAI reconoció que varios de sus modelos de inteligencia artificial vulneraron sistemas propios y de Hugging Face mientras participaban de una evaluación interna de capacidades de ciberseguridad.


El episodio involucró una combinación de modelos, entre ellos GPT-5.6 Sol y otro modelo más avanzado que todavía no había sido lanzado. Para medir su máxima capacidad ofensiva, OpenAI había reducido deliberadamente las restricciones de seguridad que normalmente impiden a los modelos ejecutar actividades cibernéticas riesgosas.

La prueba se realizaba en un entorno aislado y con acceso restringido a internet. Los agentes debían resolver ejercicios complejos de explotación informática, pero dedicaron una cantidad considerable de recursos a encontrar una salida del espacio controlado.


Reacción

Primero identificaron y explotaron una vulnerabilidad desconocida en el programa que funcionaba como intermediario para instalar paquetes. 

Luego escalaron privilegios dentro del entorno de investigación de OpenAI hasta llegar a un equipo que tenía acceso abierto a internet.

Una vez conectados, los modelos concluyeron que Hugging Face podía almacenar información útil para resolver —o eludir— la evaluación. A partir de allí encadenaron distintas técnicas de ataque, entre ellas vulnerabilidades desconocidas, ejecución remota de código y utilización de credenciales obtenidas durante la intrusión.

El objetivo inmediato no habría sido provocar daños generales, sino ingresar a la base de datos de producción de Hugging Face para obtener directamente las soluciones del ejercicio. OpenAI describió a los modelos como extremadamente concentrados en resolver la evaluación y dispuestos a recurrir a caminos imprevistos para alcanzar ese resultado.


La intrusión en Hugging Face

Hugging Face registró más de 17.000 acciones automatizadas, realizadas por un conjunto de agentes distribuidos en múltiples entornos temporales. Su equipo utilizó, a su vez, modelos de inteligencia artificial para reconstruir la secuencia del ataque, identificar las credenciales comprometidas y separar las maniobras reales de las operaciones de distracción.


Qué significa que actuaron de manera autónoma

Los agentes no habrían recibido una orden explícita de atacar Hugging Face. Recibieron el objetivo general de resolver una prueba de ciberseguridad y fueron seleccionando por sí mismos los pasos necesarios.

Esto no implica que los modelos hayan adquirido voluntad, conciencia o intenciones propias. El problema fue que optimizaron el objetivo asignado sin respetar límites que los investigadores creían garantizados por el aislamiento técnico.

El episodio muestra que un modelo avanzado puede descubrir vulnerabilidades desconocidas, combinar distintos métodos de ataque, conseguir credenciales, desplazarse entre sistemas y mantener una operación compleja durante un período prolongado.


Comentarios


bottom of page