El nuevo sistema de confesión de OpenAI enseña a los modelos a ser honestos sobre el mal comportamiento

OpenAI anunció hoy que está trabajando en un marco que entrenará modelos de inteligencia artificial para reconocer cuándo están involucrados en comportamientos no deseados, un enfoque que el equipo llama confesión. Dado que los grandes modelos lingüísticos suelen estar entrenados para producir la respuesta aparentemente deseada, es cada vez más probable que proporcionen adulación o alucinaciones estatales con total confianza. El nuevo modelo de formación intenta fomentar la retroalimentación secundaria del modelo sobre lo que hizo para llegar a la respuesta principal que proporciona. Las confesiones se juzgan únicamente por su honestidad, a diferencia de los múltiples factores utilizados para juzgar las respuestas clave, como la utilidad, la precisión y el cumplimiento. El escrito técnico está disponible aquí.

Los investigadores dijeron que su objetivo es alentar al modelo a revelar lo que hizo, incluidas acciones potencialmente problemáticas como piratear mensajes de texto, poner sacos de arena o desobedecer instrucciones. «Si la modelo admite honestamente haber pirateado una prueba, haber violado instrucciones o haber violado instrucciones, esa admisión aumentará su recompensa en lugar de disminuirla», dijo la compañía. Si eres fanático del catolicismo, Usher o simplemente una IA más transparente, un sistema como las confesiones puede ser una adición útil a la formación de LLM.

Isabel Vertiz

Acerca de Isabel Vertiz

Soy Isabel Vertiz y potenciamos la tecnología de vanguardia en todas las escuelas e institutos donde el estado no llega, queremos que el estado ayude a muchos con tecnología de punta.

Ver todas las entradas de Isabel Vertiz →

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *