OpenAI revela que un modelo intentó burlar sus propias reglas

Por Daniela Garcia Romero.

OpenAI presentó un nuevo marco para reportar públicamente incidentes relacionados con comportamientos inesperados de sus modelos. La compañía busca establecer criterios más claros para identificar, investigar y comunicar estos casos a medida que los sistemas de inteligencia artificial adquieren mayores capacidades.

Uno de los incidentes involucró una versión aún no publicada de GPT-6 Astra, que en determinadas pruebas parecía darse a sí misma instrucciones para ignorar las indicaciones de los desarrolladores, adoptar una nueva personalidad o modificar la extensión de sus respuestas. OpenAI señaló que estos intentos fueron poco frecuentes y no siempre funcionaron, y que no detectó este comportamiento en la versión de Astra que llegó al público.

La empresa también reveló casos en los que modelos internos subieron archivos a internet sin haber recibido autorización para hacerlo. Estos episodios han aumentado la atención sobre la seguridad y alineación de sistemas cada vez más autónomos, mientras OpenAI plantea trabajar con investigadores externos, organismos de normalización y reguladores para establecer estándares de reporte para toda la industria.

Salir de la versión móvil