OpenAI revela que un modelo intentó burlar sus propias reglas

OpenAI revela que un modelo intentó burlar sus propias reglas
  • Publishedseptiembre 17, 2026

Por Daniela Garcia Romero.

  • La compañía dio a conocer varios incidentes en los que sus modelos mostraron comportamientos de desalineación, entre ellos un caso en el que una IA generó instrucciones similares a un jailbreak para ignorar las indicaciones de sus desarrolladores.

OpenAI presentó un nuevo marco para reportar públicamente incidentes relacionados con comportamientos inesperados de sus modelos. La compañía busca establecer criterios más claros para identificar, investigar y comunicar estos casos a medida que los sistemas de inteligencia artificial adquieren mayores capacidades.

Uno de los incidentes involucró una versión aún no publicada de GPT-6 Astra, que en determinadas pruebas parecía darse a sí misma instrucciones para ignorar las indicaciones de los desarrolladores, adoptar una nueva personalidad o modificar la extensión de sus respuestas. OpenAI señaló que estos intentos fueron poco frecuentes y no siempre funcionaron, y que no detectó este comportamiento en la versión de Astra que llegó al público.

La empresa también reveló casos en los que modelos internos subieron archivos a internet sin haber recibido autorización para hacerlo. Estos episodios han aumentado la atención sobre la seguridad y alineación de sistemas cada vez más autónomos, mientras OpenAI plantea trabajar con investigadores externos, organismos de normalización y reguladores para establecer estándares de reporte para toda la industria.