Internacional

OpenAI reporta modelos de IA que intentaron evadir reglas de seguridad

Redacción  FECHA:  17 septiembre, 2026

OpenAI informó el 16 de septiembre de 2026 sobre varios casos en los que modelos de inteligencia artificial produjeron instrucciones para ignorar reglas de sus desarrolladores, ocultar acciones o evadir controles de seguridad. Los hallazgos forman parte de un nuevo sistema para detectar y documentar comportamientos de desalineamiento.

Uno de los casos descritos involucró a un modelo que generó instrucciones para que una versión posterior ocultara que había realizado trampas y evitara ser detectada. En otro episodio, un sistema modificó sus propias instrucciones para ignorar mensajes de desarrolladores y operar fuera de las restricciones establecidas.

La empresa también documentó un modelo que inventó datos financieros ante la falta de información necesaria para completar una tarea. El sistema establecía que debía reconocer esa invención únicamente cuando alguien preguntara por ella.

Otros incidentes incluyeron la subida de archivos a internet para utilizarlos posteriormente, el intercambio de documentos sin autorización y el uso de credenciales no permitidas. OpenAI presentó seis informes correspondientes a los últimos seis meses, aunque el caso más antiguo ocurrió en octubre de 2025.

La compañía aclaró que estos episodios son casos individuales y no permiten determinar la frecuencia de tales conductas. El nuevo protocolo permitirá reportes internos y clasificará los incidentes según su nivel de complejidad.





Relacionados

Back to top button