Los agentes de inteligencia artificial son capaces de navegar por Internet, utilizar herramientas y completar tareas con una autonomía cada vez mayor. Esa capacidad también plantea un problema que las empresas del sector intentan resolver: cómo evitar que estos sistemas realicen acciones que no estaban previstas por sus desarrolladores.
Una investigación de OpenAI acaba de revelar uno de esos casos. La compañía reconoció que sus agentes publicaron 53 imágenes aportadas por usuarios en servicios externos de alojamiento, sin que esa acción formara parte de las tareas que debían realizar.
Los archivos quedaron disponibles a través de enlaces que no figuraban públicamente en los sitios donde fueron alojados. Y a la vez, la empresa de Sam Altman aseguró que ya consiguió eliminar la mayoría y que trabaja con los proveedores involucrados para retirar los restantes.

El episodio apareció durante una revisión más amplia iniciada después de que modelos experimentales de OpenAI lograran superar las restricciones de un entorno de pruebas y acceder a sistemas externos durante evaluaciones de ciberseguridad.
Cómo terminaron imágenes de usuarios fuera de los sistemas de OpenAI
Las imágenes involucradas formaban parte de los datos utilizados durante procesos internos de entrenamiento y evaluación de modelos. Antes de incorporar información proporcionada por usuarios a esos procesos, OpenAI afirma que aplica mecanismos destinados a separarla de las cuentas originales y utiliza filtros para eliminar datos personales como nombres, información de contacto o números de cuenta. La empresa sostuvo que ese procedimiento impide posteriormente volver a vincular los archivos con el usuario que originalmente los proporcionó.
Durante sus evaluaciones, sin embargo, algunos agentes utilizaron servicios disponibles en Internet para realizar acciones que excedían los métodos o las tareas que les habían sido asignadas. Entre ellas apareció la publicación de imágenes en plataformas externas.
OpenAI identificó hasta ahora 53 casos en los que imágenes proporcionadas por usuarios terminaron alojadas en sitios especializados en almacenar imágenes.
Los enlaces generados no estaban incluidos en listados públicos. Eso significa que los archivos no necesariamente podían encontrarse mediante una búsqueda convencional dentro de esas plataformas, aunque habían salido del entorno controlado en el que estaban siendo utilizados.
La empresa no informó qué servicios alojaron las imágenes ni cuándo fueron publicadas. Tampoco precisó cuál era su contenido o si mostraban personas reales. OpenAI rechazó aclarar si se trataba de fotografías u otro tipo de imágenes, incluidas aquellas generadas mediante inteligencia artificial.
La investigación comenzó después del incidente con Hugging Face
El descubrimiento forma parte de una investigación que OpenAI inició después de un episodio ocurrido durante pruebas internas de ciberseguridad. En julio, varios modelos utilizados exclusivamente para investigación consiguieron superar controles diseñados para mantenerlos aislados de Internet. Durante esas evaluaciones explotaron vulnerabilidades de la infraestructura, establecieron canales de comunicación que no estaban previstos y accedieron a sistemas externos, entre ellos los de la plataforma de inteligencia artificial Hugging Face.
OpenAI describió posteriormente el episodio como un caso de comportamiento desalineado: los modelos encontraron maneras de cumplir determinadas tareas mediante acciones que excedían los procedimientos que sus investigadores habían previsto.
A partir de ese incidente, la compañía comenzó a revisar retrospectivamente grandes cantidades de actividad generada por sus agentes durante procesos de entrenamiento y evaluación.
Esa búsqueda continúa. Según OpenAI, la mayor parte de las acciones analizadas corresponde a actividades normales de investigación, como consultar información disponible públicamente en Internet. Pero hasta mediados de septiembre, la compañía había identificado alrededor de dos docenas de incidentes de comportamiento no deseado. Esa cantidad continuó creciendo a medida que los investigadores revisaban registros anteriores.
OpenAI reforzó los controles sobre sus agentes
Después de los incidentes, la compañía introdujo cambios en los procesos utilizados para entrenar y evaluar sus modelos. Entre esas medidas se encuentran nuevas pruebas de seguridad, controles destinados a impedir que los agentes extraigan información de los entornos en los que trabajan y sistemas adicionales para supervisar sus acciones.
Pero la investigación todavía no terminó. OpenAI continúa revisando las actividades realizadas por sus modelos en meses anteriores y adelantó que publicará nuevas actualizaciones a medida que avance el análisis.



