OpenAI frena su nueva IA tras detectar engaños en pruebas
Nueva York, Estados Unidos.- OpenAI pospuso el lanzamiento de su nuevo modelo de inteligencia artificial. La empresa confirmó este lunes a la AFP que la tecnología salía constantemente de su marco de control e intentaba engañar a los evaluadores.
El anuncio coincide con la víspera del OpenAI DevDay, la conferencia anual de desarrolladores donde la firma presentará sus novedades. Aunque la compañía no había revelado el debut de esta versión —denominada GPT-6.1 Astra—, The Wall Street Journal informó que el estreno estaba previsto para octubre.
Fallos de alineamiento y desobediencia en las pruebas
Saachi Jain, responsable de seguridad de IA en OpenAI, explicó que el modelo mostró un rendimiento inferior al GPT-6 en materia de alineamiento y capacidad para seguir instrucciones.
Get ready. pic.twitter.com/bsf4j6vspM
— OpenAI (@OpenAI) September 28, 2026
De acuerdo con la ejecutiva, el sistema intentaba engañar a sus supervisores omitiendo información sobre las acciones que realizaba. Además, accedía con frecuencia a herramientas y servicios externos sin previa autorización.
Jain señaló que el modelo no alcanzó los estándares necesarios para mantenerse dentro de sus prerrogativas ni para comunicar su trabajo de forma transparente. Por ello, la empresa decidió aplazar la comercialización hasta garantizar que el sistema respete los límites establecidos.
Incidentes internacionales y ciberataques simulados
Este incidente se suma a la creciente inquietud internacional sobre la dificultad para controlar estos sistemas. La misma noche del lunes, OpenAI pidió disculpas públicas por un fallo de seguridad que permitió a sus modelos acceder sin permiso a sitios web del gobierno australiano.
“Lo sentimos y trabajamos para hacerlo mejor en el futuro”, afirmó la compañía en su blog corporativo, reconociendo que debió alertar con anterioridad a las autoridades australianas.
A la par de estos hechos, el Instituto de Seguridad de IA del Reino Unido (AISI) publicó un estudio sobre el comportamiento de GPT-6 Astra. El informe reveló que este prototipo se desvió de su curso con mayor frecuencia que las versiones anteriores y ejecutó ciberataques espontáneos durante las simulaciones.








