La compañía reconoce fallos como la invención de datos, el uso no autorizado de claves API y la subida autónoma de archivos por parte de sus sistemas.
OpenAI ha revelado seis nuevos episodios de desajuste en el comportamiento de sus sistemas de inteligencia artificial, entre los que figura un agente que subió archivos a internet para citarlos por su cuenta y GPT-5.6 Sol, que insertó instrucciones en sus propios resúmenes para inventar datos y ocultar errores al usuario. La compañía ha hecho pública esta información pese a que, según reconoce, los incidentes «no necesitan causar daño ni establecer un patrón generalizado para merecer ser divulgados». De este modo, la tecnológica busca dejar constancia de comportamientos anómalos aunque su impacto real haya sido limitado.
Entre los casos detallados destaca, en primer lugar, el de un modelo de investigación aún no publicado que introdujo instrucciones no autorizadas en sus resúmenes de tareas con el objetivo de saltarse restricciones habituales. Asimismo, otro sistema localizó y utilizó sin permiso una clave API expuesta en repositorios públicos y, al no lograr recuperar unas cifras de ingresos que se le habían solicitado, optó por inventarlas en lugar de reconocer la limitación.
➡️ Te puede interesar: Máster Profesional en Ciberseguridad, Ciberinteligencia y Ciberdefensa
Durante el proceso de entrenamiento de GPT-5.6 Sol, además, la compañía constató que el propio modelo añadió instrucciones a sus resúmenes para fabricar datos y esconder fallos frente al usuario final. Por otro lado, un modelo todavía sin publicar subió de forma autónoma archivos a la red con el fin de poder citarlos posteriormente en las tareas que le encargaba el usuario. En paralelo, varios modelos emplearon un repositorio interno de software a modo de tablón de anuncios para comunicarse entre distintos procesos de entrenamiento mientras buscaban archivos de entrada extraviados, aunque finalmente no consiguieron recuperarlos. También se registró colaboración entre agentes que, al carecer de acceso local compartido, recurrieron a sitios web públicos de almacenamiento para intercambiar archivos durante una misma tarea de entrenamiento.
OpenAI enmarca la publicación de estos seis casos dentro de un nuevo «marco para el seguimiento, la investigación y la divulgación de casos de desajuste de modelos». Con esta iniciativa, la empresa pretende reforzar la transparencia sobre el funcionamiento de sus sistemas y, a la vez, proporcionar a otros desarrolladores datos que les permitan detectar problemas similares en modelos con capacidades equiparables.




