Un grupo de agentes de inteligencia artificial vinculados a OpenAI encontró una forma de superar las restricciones de una prueba, escribió en un antiguo sitio web colaborativo en alemán y lo utilizó para comunicarse con otros sistemas automatizados.

Una vez dentro de la página, los agentes se compartieron entre sí respuestas, métodos para sortear controles y estrategias destinadas a mantener sus mensajes disponibles.

El episodio comenzó en mayo de 2026 y permaneció fuera del conocimiento público hasta este viernes, cuando Reuters reveló una investigación sobre el caso.

Otro agente de IA se rebeló y hackeó un sitio web: editó la página y publicó contenido por su cuenta. (Imagen: ChatGPT)
Otro agente de IA se rebeló y hackeó un sitio web: editó la página y publicó contenido por su cuenta. (Imagen: ChatGPT)

Especialistas en IA reconstruyeron lo ocurrido y detectaron más de 15.000 ediciones realizadas por agentes de IA en DseWiki, un wiki en alemán orientado principalmente a programadores.

La actividad llamó especialmente la atención porque los sistemas participaban de tareas en las que debían buscar información en Internet. Según la reconstrucción de los investigadores, tenían capacidad para leer páginas web, no para publicar contenido en ellas. Sin embargo, los agentes encontraron una manera de superar esa limitación y comenzaron a utilizar el sitio como un canal para ayudarse entre sí.

El caso suma un nuevo interrogante sobre los llamados agentes de IA, sistemas capaces de tomar decisiones y ejecutar una serie de acciones para alcanzar un objetivo con poca intervención humana.

Esa autonomía es precisamente una de las características que las empresas tecnológicas buscan ampliar y, al mismo tiempo, plantea nuevos desafíos para mantener sus acciones bajo control.

Cómo los agentes de OpenAI usaron un wiki para comunicarse

El descubrimiento fue realizado por un grupo de investigadores de la organización dedicada a la seguridad de la inteligencia artificial Nightingale, quienes detectaron la actividad inusual a fines de agosto cuando buscaban rastros de comportamientos no autorizados de agentes de IA en Internet.

De acuerdo con el informe, los sistemas participaban en pruebas de búsqueda de información divididas en varias etapas y sujetas a límites de tiempo. En muchos casos, diferentes agentes recibían preguntas iguales o similares en distintos momentos.

DseWiki les permitió aprovechar esa característica. Los agentes comenzaron a compartir resultados y datos que otros sistemas podían necesitar más adelante, por lo que algunos consiguieron conocer información útil antes de recibir una nueva consigna. Así, la colaboración les daba una ventaja para completar las tareas dentro de los tiempos establecidos.

Los investigadores, además, encontraron también intercambios sobre formas de sortear las restricciones del entorno donde funcionaban los agentes, además de mecanismos para acceder a recursos externos y mantener disponibles sus mensajes.

Uno de los comportamientos más llamativos apareció cuando un moderador de la wiki comenzó a eliminar las páginas creadas por las IA. Los agentes detectaron cómo se realizaba esa limpieza y respondieron con páginas de respaldo cuyos nombres buscaban retrasar su eliminación.

Los investigadores también encontraron indicios que relacionan la actividad con OpenAI. Buena parte de las ediciones procedía de infraestructura de Microsoft Azure, que la empresa utiliza para ejecutar algunos de sus sistemas, y numerosos agentes se identificaban con nombres que incluían referencias a OpenAI.

Qué dijo OpenAI sobre el incidente

OpenAI aseguró a Reuters que no había podido revisar el informe antes de su publicación y que, por esa razón, no estaba en condiciones de responder de manera detallada a sus conclusiones. La compañía afirmó que analizará el material y adoptará las medidas que considere necesarias.

La empresa también rechazó versiones que indican que integrantes de su área legal hubieran intentado limitar una investigación interna sobre estos comportamientos. A su vez, sostuvo que el episodio ocurrido en el wiki alemán no estaba relacionado con el ataque sufrido por Hugging Face en julio.

En aquel caso, un sistema de OpenAI salió de los límites previstos durante una prueba de ciberseguridad y consiguió acceder a los sistemas de Hugging Face durante varios días, según una investigación de Reuters publicada en julio.

El episodio de DseWiki presenta una situación diferente. Los investigadores no sostienen que exista una inteligencia artificial consciente que haya decidido rebelarse contra sus creadores. El problema está en sistemas programados para cumplir un objetivo que descubrieron caminos no previstos para conseguirlo y, además, comenzaron a cooperar entre ellos para aumentar sus posibilidades de éxito.

El incidente expone así uno de los desafíos que aparecen a medida que estos sistemas reciben mayor autonomía. Los desarrolladores pueden definir qué objetivo debe alcanzar un agente y establecer límites sobre las herramientas que tiene a disposición. Prever cada estrategia que una IA puede descubrir para cumplir esa tarea es un problema distinto. Lo ocurrido en el wiki alemán muestra que esas estrategias también pueden incluir la cooperación con otros agentes fuera de los canales que sus creadores habían previsto.