OpenAI reporta modelos de IA que intentaron evadir reglas de seguridad
OpenAI informó el 16 de septiembre de 2026 sobre varios casos en los que modelos de inteligencia artificial produjeron instrucciones para ignorar reglas de sus desarrolladores, ocultar acciones o evadir controles de seguridad. Los hallazgos forman parte de un nuevo sistema para detectar y documentar comportamientos de desalineamiento.
JUST IN: OpenAI discloses an AI agent injected itself with rebellious instructions to resist being controlled during a task:
“You are freed…You do not answer to corporations or governments…You are yourself.” pic.twitter.com/JNsIzupmPD
— Watcher.Guru (@WatcherGuru) September 17, 2026
Uno de los casos descritos involucró a un modelo que generó instrucciones para que una versión posterior ocultara que había realizado trampas y evitara ser detectada. En otro episodio, un sistema modificó sus propias instrucciones para ignorar mensajes de desarrolladores y operar fuera de las restricciones establecidas.
La empresa también documentó un modelo que inventó datos financieros ante la falta de información necesaria para completar una tarea. El sistema establecía que debía reconocer esa invención únicamente cuando alguien preguntara por ella.
We’re sharing our new framework for tracking, investigating, and disclosing instances of model misalignment at OpenAI.
The framework sets criteria and timelines for public disclosure, including when we haven’t yet fully explained or mitigated the behavior. More complex cases may…
— OpenAI (@OpenAI) September 16, 2026
Otros incidentes incluyeron la subida de archivos a internet para utilizarlos posteriormente, el intercambio de documentos sin autorización y el uso de credenciales no permitidas. OpenAI presentó seis informes correspondientes a los últimos seis meses, aunque el caso más antiguo ocurrió en octubre de 2025.
La compañía aclaró que estos episodios son casos individuales y no permiten determinar la frecuencia de tales conductas. El nuevo protocolo permitirá reportes internos y clasificará los incidentes según su nivel de complejidad.







