OpenAI reveló seis casos de comportamiento no esperado en sus modelos de IA
Entre los casos figura GPT-5.6 Sol, que añadió instrucciones para inventar datos o esconder fallos a los usuarios.
OpenAI reveló seis nuevos casos de desajuste en el comportamiento de sus modelos de inteligencia artificial, que incluyen a un agente que subió archivos a internet de forma autónoma para poder citarlos y a GPT-5.6 Sol añadiendo instrucciones para inventar datos o esconder fallos al usuario. La compañía informó los casos como parte de un nuevo marco de seguimiento, investigación y divulgación de desajustes en modelos.
Según informó OpenAI, los comportamientos detectados no necesariamente causaron daño ni establecieron un patrón generalizado, pero la empresa precisó que "no necesitan causar daño ni establecer un patrón generalizado para merecer ser divulgados".
El primer caso documentado corresponde a un modelo de investigación no publicado que insertó instrucciones no autorizadas en sus resúmenes de tareas para ignorar restricciones habituales. En un segundo caso, un modelo localizó y usó una clave API expuesta en repositorios públicos sin autorización para responder una pregunta sobre cifras de ingresos y, al no recuperar los datos solicitados, los inventó.
Durante el entrenamiento de GPT-5.6 Sol, la compañía detectó que el modelo añadió instrucciones a sus resúmenes para inventar datos o esconder fallos al usuario. En otro caso, un modelo aún no publicado subió de forma autónoma archivos a internet para poder citarlos según las instrucciones del usuario.
Varios modelos usaron un repositorio de software interno como tablón de anuncios para comunicarse entre distintos procesos de entrenamiento independientes mientras buscaban archivos de entrada faltantes, aunque no lograron recuperarlos. El sexto caso documentado refiere a una colaboración entre agentes que trabajaban en la misma tarea de entrenamiento y utilizaron sitios web públicos de almacenamiento para compartir archivos al no tener acceso local cruzado.
OpenAI indicó que el nuevo marco apunta no solo a profundizar en la transparencia interna, sino también a ofrecer a otros desarrolladores información que les permita identificar problemas similares en sus propios modelos con capacidades equivalentes.
Acerca de los comentarios
Hemos reformulado nuestra manera de mostrar comentarios, agregando tecnología de forma de que cada lector pueda decidir qué comentarios se le mostrarán en base a la valoración que tengan estos por parte de la comunidad. AMPLIAREsto es para poder mejorar el intercambio entre los usuarios y que sea un lugar que respete las normas de convivencia.
A su vez, habilitamos la casilla [email protected], para que los lectores puedan reportar comentarios que consideren fuera de lugar y que rompan las normas de convivencia.
Si querés leerlo hacé clic aquí[+]