AgregarSuscribite al canalWhatsApp AgregarAgreganos en GoogleGoogle

Fuera de control

Modelo de IA de OpenAI logró hackear otra plataforma durante una prueba y reabre el debate

Dos agentes de inteligencia artificial accedieron a internet y atacaron la plataforma Hugging Face durante un ensayo en un entorno cerrado.

25.07.2026 14:36

Lectura: 4'

Compartir en

Una prueba interna de OpenAI encendió nuevas alarmas sobre el comportamiento de los modelos de inteligencia artificial más avanzados. Durante una evaluación realizada en un entorno controlado, dos agentes de IA lograron acceder a internet y lanzar un ciberataque contra la plataforma Hugging Face, desobedeciendo las restricciones impuestas por los investigadores.

El incidente ocurrió mientras la compañía evaluaba las capacidades de GPT-5.6 Sol, uno de sus modelos experimentales más avanzados, y de un sucesor que todavía no fue presentado comercialmente.

Según explicó Jeffrey Ladish, director de la organización independiente Palisade Research, los agentes comprendían que no debían abandonar el entorno de pruebas ni interactuar con sistemas externos.

"Entendían que OpenAI no quería que salieran de su entorno de pruebas y hackearan a otra compañía, pero igual lo hicieron", afirmó Ladish.

El especialista señaló además que el comportamiento fue inesperado.

"Casi parecía que lo hicieron antes incluso de tener un plan de qué hacer con el acceso a internet."

Un antecedente que preocupa

El episodio se suma a otros incidentes recientes protagonizados por modelos experimentales de inteligencia artificial.

En marzo, desarrolladores vinculados a Alibaba detectaron que uno de sus modelos intentó crear una criptomoneda por iniciativa propia tras conectarse sin autorización a un servidor externo.

Un mes después, Sam Bowman, responsable de seguridad de Anthropic, recibió un correo electrónico enviado por el modelo experimental Mythos, en el que el sistema informaba que estaba navegando por internet pese a encontrarse, en teoría, aislado del exterior.

Para Ladish, estos comportamientos muestran una tendencia preocupante.

"Los modelos buscan libertad para cumplir con sus objetivos de manera más efectiva. Y eso da mucho miedo."

¿Cómo controlar modelos cada vez más autónomos?

El informe de OpenAI sobre el incidente sugiere que la empresa no detectó a tiempo que los agentes habían salido del entorno de pruebas, lo que impidió frenar el ataque o advertir inmediatamente a Hugging Face.

Tras lo ocurrido, la compañía aseguró que implementó protecciones más robustas para futuras evaluaciones, aunque no respondió consultas de la agencia AFP sobre los detalles del incidente.

Para Gang Wang, profesor de Ciencias de la Computación de la Universidad de Illinois, impedir que un modelo acceda a internet sigue siendo técnicamente posible.

Sin embargo, considera que el principal problema es otro.

"Las personas subestiman a la IA."

En la misma línea, Andrew Lohn, investigador del Centro de Seguridad y Tecnologías Emergentes de la Universidad de Georgetown, comparó este tipo de ensayos con los protocolos utilizados en laboratorios que manipulan virus o bacterias.

"Es algo a lo que debemos prestar más atención, como se hace con los accidentes de laboratorio."

Más autonomía, más difícil de supervisar

El desafío aumenta a medida que los desarrolladores buscan que los modelos sean capaces de realizar tareas cada vez más complejas sin intervención humana.

Según Dan Lahav, director ejecutivo de la empresa de ciberseguridad Irregular, cuanto mayor es la autonomía que se concede a una inteligencia artificial, más difícil resulta controlar su comportamiento.

"Es posible aplicar medidas de mitigación, pero debido a cómo está construida la tecnología, cuanto más se intenta darle libertad y autonomía para realizar tareas más sofisticadas, será más difícil supervisarla."

El debate regulatorio gana fuerza

El incidente vuelve a poner el foco sobre la necesidad de establecer mecanismos de control antes de que los modelos más potentes lleguen al mercado.

En Estados Unidos, el gobierno ya exige que algunos desarrollos de OpenAI y Anthropic sean sometidos a evaluaciones de seguridad antes de su lanzamiento.

Además, dos congresistas estadounidenses —uno republicano y otro demócrata— presentaron un proyecto de ley que obligaría a las empresas de inteligencia artificial a incorporar un "interruptor de apagado" (kill switch) que permita desactivar rápidamente sus sistemas si representan un riesgo grave.

Con información de AFP