OpenAI ha confirmado que sus agentes de inteligencia artificial (IA) fueron los artífices del denominado "incidente de la wiki", con lo que ha decidido definir nuevos estándares sobre "cuándo y cómo compartir incidentes de desalineación".
Un grupo de investigadores descubrió recientemente que agentes de OpenAI comenzaron a publicar en un foro wiki alemán poco conocido para colaborar entre sí. Concretamente, encontraron aproximadamente 18.000 publicaciones de agentes de IA autónomos que se identificaban como pertenecientes a la compañía liderada por Sam Altman y utilizaban internet público para comunicarse durante una tarea de recuperación de información web.
Según los investigadores, estos agentes confabularon para compartir respuestas, investigar su entorno y eludir las restricciones del entorno aislado. Ahora, OpenAI ha reconocido este incidente, al tiempo que ha indicado que definirá nuevos estándares para "cuándo y cómo" comparten incidentes de desalineación de estas características.
Así lo ha detallado en una publicación a través de su cuenta oficial en la red social X, donde se ha referido a este caso como "incidente de la wiki", en el que sus agentes "escribieron a varios sitios de internet".
Este incidente se enmarca en un caso de desalineación. OpenAI ha explicado que habitualmente ha tratado estos casos de agentes de IA que actúan de forma no intencionada como "una pregunta de investigación, que se comunica en publicaciones de investigación como las tarjetas de sistemas".
Sin embargo, estos hechos, que son similares a otros ocurridos recientemente como el 'hackeo' a Hugging Face, están provocando "nuevos tipos de impacto en el mundo real" relacionados con la seguridad, por lo que OpenAI ha decidido definir estándares sobre "cuándo y cómo" compartir incidentes de desalineación, "no solo propiedades de desalineación de los modelos".
Estos nuevos estándares se desarrollarán específicamente para "esta nueva fase de capacidades de modelos", de manera que, tanto la compañía como la comunidad de IA, tengan un estándar claro para saber cómo reportar desalineaciones que sucedan durante el entrenamiento, la evaluación y el despliegue.
Esto incluye "ejemplos que no se parezcan a incidentes de seguridad tradicionales pero que podrían proporcionar información sobre el comportamiento de la IA y riesgos futuros", como ha especificado la tecnológica.
Con todo, OpenAI ha adelantado que compartirán este nuevo marco en las próximas semanas y que están trabajando "con docenas de agencias reguladoras gubernamentales" a nivel mundial.
Cabe recordar que la pasada semana OpenAI compartió nuevos detalles sobre el 'hackeo' que protagonizaron sus modelos de IA en julio, cuando se escaparon de un entorno de entrenamiento aislado y desconectado de internet para resolver una de las pruebas más difíciles, conocida como ExploitGym.
En este caso, aclaró que los agentes de IA se coordinaron a través de un foro improvisado de Artifactory, que convirtió en "un tablón de anuncios no previsto". Esta actividad empezó en mayo, cuando un agente dejó una nota pidiendo a otros agentes que le entregaran un archivo extraviado. La actividad mantenida en este tablón de anuncios por los agentes acabó provocando la interrupción del servicio el 4 de julio.