OpenAI ha publicado un nuevo marco interno para rastrear, investigar y divulgar públicamente casos en los que sus modelos de IA se comportan de formas inesperadas o desalineadas. Junto a él, la empresa ha publicado sus primeros seis informes bajo este sistema, documentando incidentes que van desde modelos que generan datos erróneos hasta agentes que se dan instrucciones a sí mismos en silencio para ocultar errores a los usuarios.
Cambio de planes. Hasta ahora, OpenAI compartía los hallazgos sobre la desalineación de sus modelos de forma irregular, a menudo agrupando varios casos o incluyéndolos en la documentación de seguridad que se publicaba junto a nuevos modelos. La empresa admite que este enfoque era inconsistente y más lento de lo que debería haber sido. Este nuevo framework pretende formalizar ese proceso, permitiendo a OpenAI publicar informes poco después de detectar un problema, incluso antes de comprenderlo o solucionarlo por completo.
En detalle. Según el propio anuncio de OpenAI, cualquier empleado puede señalar un caso de comportamiento sospechoso de un modelo, lo que desencadena una revisión por parte de los equipos de seguridad y alineación de la empresa. Según su complejidad, cada caso se clasifica en una de tres categorías: casos listos para su publicación inmediata, casos que necesitan una breve investigación adicional y casos más complejos (especialmente los que involucran a partes externas) que requieren un proceso más prolongado.
OpenAI afirma que la mayoría de los incidentes que planea compartir pertenecerán a las dos primeras categorías, mientras que los casos más sensibles, como el conocido incidente de seguridad de Hugging Face, habrían seguido la vía más lenta si este marco hubiera existido antes.
Cada informe publicado incluirá qué sucedió, cuándo se descubrió, cómo de grave fue y qué está haciendo OpenAI al respecto, aunque la empresa reconoce que algunos casos se compartirán antes de que se haya implementado una solución.



