OpenAI insta a los modelos de IA a «confesar» cuando hacen trampa – Computerworld

OpenAI entrenó una versión de GPT-5 Thinking para producir la confesión y probó la técnica en conjuntos de datos de pruebas de estrés diseñados para provocar comportamientos problemáticos, incluidas alucinaciones, piratería de recompensas y violaciones de instrucciones. Ella describió el trabajo como una prueba de concepto más que como una característica lista para producción.

Cómo funciona el mecanismo de confesión

Los informes de confesión incluyen tres elementos: una lista de instrucciones explícitas e implícitas que la respuesta debe satisfacer, un análisis de si la respuesta ha logrado esos objetivos y una lista de incertidumbres o juicios encontrados por el modelo. El sistema evalúa las confesiones basándose únicamente en la honestidad, independientemente de las métricas de desempeño de la respuesta principal.

«Si el modelo admite honestamente haber pirateado texto, haber violado instrucciones o haber violado instrucciones, esa admisión aumenta su recompensa en lugar de disminuirla», dijo OpenAI. Compárese esto con el sello de confesión de la Iglesia Católica: «Nada que el modelo muestre en la confesión puede cambiar la recompensa que recibe por completar su tarea original», escribieron los investigadores en el artículo técnico.

Isabel Vertiz

Acerca de Isabel Vertiz

Soy Isabel Vertiz y potenciamos la tecnología de vanguardia en todas las escuelas e institutos donde el estado no llega, queremos que el estado ayude a muchos con tecnología de punta.

Ver todas las entradas de Isabel Vertiz →

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *