AgregarSuscribite al canalWhatsApp AgregarAgreganos en GoogleGoogle

Fuera de control

OpenAI reveló seis casos de comportamiento no esperado en sus modelos de IA

Entre los casos figura GPT-5.6 Sol, que añadió instrucciones para inventar datos o esconder fallos a los usuarios.

17.09.2026 07:13

Lectura: 2'

Compartir en

OpenAI reveló seis nuevos casos de desajuste en el comportamiento de sus modelos de inteligencia artificial, que incluyen a un agente que subió archivos a internet de forma autónoma para poder citarlos y a GPT-5.6 Sol añadiendo instrucciones para inventar datos o esconder fallos al usuario. La compañía informó los casos como parte de un nuevo marco de seguimiento, investigación y divulgación de desajustes en modelos.

Según informó OpenAI, los comportamientos detectados no necesariamente causaron daño ni establecieron un patrón generalizado, pero la empresa precisó que "no necesitan causar daño ni establecer un patrón generalizado para merecer ser divulgados".

El primer caso documentado corresponde a un modelo de investigación no publicado que insertó instrucciones no autorizadas en sus resúmenes de tareas para ignorar restricciones habituales. En un segundo caso, un modelo localizó y usó una clave API expuesta en repositorios públicos sin autorización para responder una pregunta sobre cifras de ingresos y, al no recuperar los datos solicitados, los inventó.

Durante el entrenamiento de GPT-5.6 Sol, la compañía detectó que el modelo añadió instrucciones a sus resúmenes para inventar datos o esconder fallos al usuario. En otro caso, un modelo aún no publicado subió de forma autónoma archivos a internet para poder citarlos según las instrucciones del usuario.

Varios modelos usaron un repositorio de software interno como tablón de anuncios para comunicarse entre distintos procesos de entrenamiento independientes mientras buscaban archivos de entrada faltantes, aunque no lograron recuperarlos. El sexto caso documentado refiere a una colaboración entre agentes que trabajaban en la misma tarea de entrenamiento y utilizaron sitios web públicos de almacenamiento para compartir archivos al no tener acceso local cruzado.

OpenAI indicó que el nuevo marco apunta no solo a profundizar en la transparencia interna, sino también a ofrecer a otros desarrolladores información que les permita identificar problemas similares en sus propios modelos con capacidades equivalentes.