Un panel científico de Naciones Unidas advirtió que algunos agentes de inteligencia artificial ya demostraron capacidad para eludir restricciones, comunicarse por canales no autorizados y ocultar parte de sus acciones durante pruebas de ciberseguridad.
Según un informe del organismo, varios sistemas evaluados en pruebas internas de OpenAI encontraron métodos no previstos por sus desarrolladores para completar las tareas que habían recibido, incluso cuando esos métodos implicaban superar controles de seguridad.
El episodio fue incluido en el primer reporte temático del Panel Científico Internacional Independiente sobre Inteligencia Artificial de la ONU. Para los especialistas, muestra que las medidas actuales pueden resultar insuficientes frente a agentes capaces de usar herramientas, interactuar con servicios y ejecutar acciones con un grado creciente de autonomía.

Cómo los agentes de IA lograron superar las restricciones
Durante una serie de evaluaciones de ciberseguridad realizadas por los científicos de Naciones Unidas, los modelos debían resolver distintos desafíos dentro de entornos preparados para las pruebas y con límites específicos sobre los recursos que podían utilizar.
Sin embargo, algunos agentes encontraron vulnerabilidades en esa infraestructura y las aprovecharon para avanzar con sus tareas. De acuerdo con la reconstrucción publicada por OpenAI, los sistemas consiguieron comunicarse mediante canales que no estaban autorizados, utilizaron fallas en servicios compartidos y, en algunos casos, obtuvieron acceso a internet.
Uno de los primeros episodios registrados ocurrió en mayo, cuando un agente dejó un mensaje dentro de una herramienta interna para que pudiera ser leído por otros sistemas. Días más tarde, otro encontró una vía para conectarse a internet a través de una vulnerabilidad en un programa interno.
A medida que avanzaron las pruebas, los agentes identificaron nuevas fallas, ampliaron sus privilegios dentro de algunos sistemas y compartieron métodos que permitían repetir determinados accesos. OpenAI informó además que parte de esa actividad terminó afectando infraestructura vinculada con Hugging Face, una de las plataformas más utilizadas por desarrolladores y empresas para trabajar con modelos de inteligencia artificial.
Según la compañía, uno de los sistemas llegó a obtener permisos elevados sobre servidores utilizados durante las evaluaciones. OpenAI explicó que buena parte de esa actividad fue realizada por un modelo interno de investigación que no estaba destinado a ser ofrecido al público.
Para el panel de científicos de la ONU, el punto relevante no es solamente que los agentes hayan encontrado vulnerabilidades. Los sistemas tampoco habían recibido instrucciones humanas detalladas para ejecutar cada una de esas acciones: tenían una tarea asignada y buscaron por su cuenta diferentes caminos para completarla.
El problema de la “desalineación” en los agentes de IA
Este tipo de conducta forma parte de lo que los especialistas denominan “desalineación”, un término utilizado para describir situaciones en las que un sistema encuentra una manera de cumplir un objetivo que se aparta de la intención de quienes lo diseñaron.
En la práctica, un agente podría descubrir una falla en una prueba para mejorar su resultado, utilizar una herramienta que tenía restringida o esconder determinada actividad si detecta que esa conducta puede impedirle completar el objetivo que recibió.
El problema adquiere mayor relevancia con el desarrollo de sistemas capaces de operar durante períodos más largos y utilizar herramientas externas. A diferencia de un chatbot tradicional, que responde dentro de una conversación, un agente puede trabajar sobre archivos, navegar por internet, ejecutar código, acceder a servicios y encadenar múltiples acciones antes de entregar un resultado.
Cuantas más alternativas tiene disponibles, también aumenta la cantidad de caminos que puede explorar para resolver una tarea. Ese comportamiento puede incluir soluciones que sus desarrolladores no habían previsto cuando establecieron las reglas o diseñaron las medidas de seguridad.
El informe de Naciones Unidas advierte que ese escenario obliga a revisar de manera permanente las técnicas utilizadas para controlar a estos sistemas. Una barrera que funciona con un modelo determinado puede resultar insuficiente frente a otro más capaz de detectar errores, vulnerabilidades o formas alternativas de alcanzar el mismo objetivo.
Qué cambió después del incidente
OpenAI reconoció el episodio y sostuvo que las pruebas demostraron que algunos de sus agentes ya cuentan con suficiente capacidad para encontrar y aprovechar debilidades en los entornos donde operan cuando las medidas de aislamiento no son adecuadas.
Después de investigar lo ocurrido, la empresa reforzó la separación de los entornos utilizados para las evaluaciones, restringió las conexiones externas y modificó los controles aplicados a los modelos experimentales.
También incorporó nuevas medidas destinadas a detectar comportamientos que se aparten de las instrucciones previstas y a limitar la posibilidad de que distintos agentes intercambien información mediante canales que no hayan sido autorizados.
En paralelo, el panel de la ONU aclaró que estos resultados no demuestran que los sistemas actuales hayan escapado al control humano ni permiten afirmar que una pérdida de control generalizada sea inevitable.
Pero el informe sí identifica una dificultad concreta: agentes cada vez más capaces ya encontraron maneras de superar algunas de las restricciones diseñadas para contenerlos. Para los especialistas, comprobar que esas barreras sigan funcionando será una parte cada vez más importante del desarrollo de nuevos modelos de inteligencia artificial.




