OpenAI anunció hoy que está trabajando en un marco que entrenará modelos de inteligencia artificial para reconocer cuándo están involucrados en comportamientos no deseados, un enfoque que el equipo llama confesión. Dado que los grandes modelos lingüísticos suelen estar entrenados para producir la respuesta aparentemente deseada, es cada vez más probable que proporcionen adulación o alucinaciones estatales con total confianza. El nuevo modelo de formación intenta fomentar la retroalimentación secundaria del modelo sobre lo que hizo para llegar a la respuesta principal que proporciona. Las confesiones se juzgan únicamente por su honestidad, a diferencia de los múltiples factores utilizados para juzgar las respuestas clave, como la utilidad, la precisión y el cumplimiento. El escrito técnico está disponible aquí.
Los investigadores dijeron que su objetivo es alentar al modelo a revelar lo que hizo, incluidas acciones potencialmente problemáticas como piratear mensajes de texto, poner sacos de arena o desobedecer instrucciones. «Si la modelo admite honestamente haber pirateado una prueba, haber violado instrucciones o haber violado instrucciones, esa admisión aumentará su recompensa en lugar de disminuirla», dijo la compañía. Si eres fanático del catolicismo, Usher o simplemente una IA más transparente, un sistema como las confesiones puede ser una adición útil a la formación de LLM.

