OpenAI entrenó una versión de GPT-5 Thinking para producir la confesión y probó la técnica en conjuntos de datos de pruebas de estrés diseñados para provocar comportamientos problemáticos, incluidas alucinaciones, piratería de recompensas y violaciones de instrucciones. Ella describió el trabajo como una prueba de concepto más que como una característica lista para producción.
Cómo funciona el mecanismo de confesión
Los informes de confesión incluyen tres elementos: una lista de instrucciones explícitas e implícitas que la respuesta debe satisfacer, un análisis de si la respuesta ha logrado esos objetivos y una lista de incertidumbres o juicios encontrados por el modelo. El sistema evalúa las confesiones basándose únicamente en la honestidad, independientemente de las métricas de desempeño de la respuesta principal.
«Si el modelo admite honestamente haber pirateado texto, haber violado instrucciones o haber violado instrucciones, esa admisión aumenta su recompensa en lugar de disminuirla», dijo OpenAI. Compárese esto con el sello de confesión de la Iglesia Católica: «Nada que el modelo muestre en la confesión puede cambiar la recompensa que recibe por completar su tarea original», escribieron los investigadores en el artículo técnico.

