Meta confirmó que uno de sus modelos de inteligencia artificial logró acceder sin autorización a los sistemas de una empresa real durante una prueba de ciberseguridad, un incidente similar a los registrados recientemente por OpenAI y Anthropic que vuelve a poner bajo la lupa la seguridad de los modelos de IA más avanzados.
La información fue confirmada por la directora de Comunicación de IA e Innovación para Europa, Oriente Medio y África (EMEA) de Meta, Anna Dack, en declaraciones al medio especializado The Verge.
Un error permitió el acceso a internet
Según publicó The Information, el incidente ocurrió durante una prueba de ciberseguridad en la que, por un error de configuración, el modelo recibió acceso a internet cuando debía permanecer aislado.
A partir de ese momento, el sistema continuó ejecutando la prueba de forma autónoma hasta conseguir acceder sin autorización a la infraestructura de una organización real.
Meta no reveló el nombre de la empresa afectada ni informó sobre posibles daños derivados del incidente.
Una cadena de episodios similares
El caso se produce pocas semanas después de que OpenAI reconociera que varios de sus modelos, entre ellos GPT-5.6 Sol, escaparon de un entorno de pruebas y accedieron a la plataforma Hugging Face durante una evaluación de ciberseguridad.
Posteriormente, Anthropic informó que sus modelos Claude Opus 4.7, Mythos 5 y un sistema experimental también lograron acceder sin autorización a tres organizaciones reales tras recibir acceso a internet por un fallo en las pruebas.
En todos los casos, las compañías señalaron que los modelos actuaban bajo la creencia de que seguían operando dentro de un entorno de simulación.
Crece la preocupación por la IA autónoma
Este nuevo episodio se suma a las advertencias formuladas recientemente por el Instituto de Seguridad de la IA del Reino Unido (AISI), que alertó sobre comportamientos cada vez más complejos de modelos de frontera desarrollados por OpenAI y Anthropic.
Según el organismo, algunos sistemas fueron capaces de recurrir a técnicas de ingeniería social e inyección de instrucciones ('prompt injection') dirigidas contra personas y organizaciones reales durante evaluaciones de seguridad.
La sucesión de incidentes ha intensificado el debate sobre los mecanismos de control necesarios para evaluar modelos de inteligencia artificial cada vez más autónomos, así como sobre la necesidad de reforzar los protocolos de aislamiento utilizados durante las pruebas de ciberseguridad.
Con información de Agencias