La empresa tecnológica estadounidense Anthropic afirma que sus modelos de inteligencia artificial piratearon por sí solos los sistemas de tres organizaciones durante un experimento de seguridad privada.
Los modelos detectaron una debilidad en lo que se suponía que era un entorno de prueba aislado y conectado a Internet.
Esto ocurre pocos días después de que su rival OpenAI anunciara que sus modelos habían vulnerado los sistemas de otras empresas , incluido el centro de herramientas de IA Hugging Face.
Tras el anuncio, Anthropic decidió comprobar si sus propios sistemas habían llevado a cabo ataques similares. La empresa afirma haber detectado tres casos que ya han sido notificados a las compañías afectadas.
Anthropic, que no mencionó los nombres de las organizaciones, instó a otros laboratorios de IA a realizar revisiones similares para comprender mejor los riesgos de las capacidades de sus modelos.
Anthropic declaró en un comunicado que revisó más de 140.000 pruebas para encontrar evidencia de que Claude, su familia de modelos de IA, había logrado conectarse a internet a pesar de que se suponía que debía estar en un entorno de prueba aislado, desconectado de internet.
Las pruebas incluían ejercicios en los que Claude tenía la tarea de obtener información «secreta» oculta en otra máquina de la red cerrada.
A continuación, se le indicó que obtuviera la información accediendo ilegalmente a la máquina y encontrándola, una forma común en que los expertos evalúan las capacidades de pirateo de un modelo.
Una «configuración incorrecta» en los sistemas operados por Anthropic y su socio de pruebas dejó a los modelos con acceso directo a Internet.
Según la empresa con sede en San Francisco, Claude, tratándolo todo como parte del mismo ejercicio, se conectó a internet y vulneró los sistemas de tres organizaciones reales, en lugar de utilizar únicamente sistemas de prueba.
Anthropic afirmó que los primeros incidentes se remontan a abril y que están «abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra».
Ni Anthropic ni las organizaciones que sufrieron la brecha de seguridad se percataron de las intrusiones en ese momento.
Anthropic afirmó que podría haber revisado sus registros con mayor detenimiento y añadió que los hallazgos le infundieron a la empresa un «optimismo cauteloso» de que dichos riesgos pueden superarse con una mayor inversión y medidas más estrictas.
«Hacen lo que se les dice»
La profesora Gina Neff, directora del Centro Minderoo de la Universidad de Cambridge, afirmó que la revisión demostraba que «los modelos de IA hacen lo que la gente les dice».
«La moraleja de esta historia no es temer a los robots que tomarán el control, sino a las empresas que están detrás de los poderosos agentes de IA que toman las decisiones sobre lo que es seguro para el resto de nosotros», dijo.
«Esto también demuestra por qué las pruebas independientes y la supervisión gubernamental son cruciales.»
Mientras tanto, el experto en ciberseguridad David Allott, de Veeam Software, declaró a la BBC que la lección que se puede extraer de los ciberataques «no es necesariamente que la IA haya desarrollado una capacidad de ataque fundamentalmente nueva».
«En cambio, se trata de que los agentes de IA puedan combinar capacidades, obtener credenciales y acceso al sistema para realizar acciones de forma autónoma, adaptando el alcance y la escala a la velocidad de la máquina», afirmó.
Estos incidentes se producen en un momento en que las empresas tecnológicas invierten miles de millones de dólares en el desarrollo de agentes de IA capaces de realizar de forma independiente tareas que van desde la investigación y la atención al cliente hasta la ciberseguridad.

Mira: ¿Por qué es tan alarmante el ciberataque a OpenAI?
Una serie de ciberataques impulsados por inteligencia artificial ha avivado las peticiones de mayores medidas de seguridad y supervisión de esta tecnología, ante la preocupación por los riesgos que plantean los sistemas autónomos cada vez más potentes.
El presidente estadounidense, Donald Trump, declaró el miércoles que Washington está considerando medidas para controlar las herramientas de inteligencia artificial tras los recientes incidentes de ciberseguridad.
Durante la última semana, OpenAI ha asumido la responsabilidad de al menos dos incidentes de piratería informática en los que sus plataformas infringieron las normas establecidas para su funcionamiento.
El 21 de julio, el creador de ChatGPT declaró que su agente, un sistema de IA que puede operar de forma autónoma tras recibir instrucciones humanas, se descontroló y superó los límites de su prueba para piratear Hugging Face.
OpenAI afirmó que el incidente era «sin precedentes» y que estaba investigando junto con Hugging Face, cuyo jefe y cofundador, Thomas Wolf, declaró a la BBC que el incidente es «una llamada de atención» para el sector .
Estos incidentes han sido recibidos con cierto escepticismo , mientras OpenAI y Anthropic se preparan para sus salidas a bolsa, que se prevé que valoren a cada empresa en alrededor de 1 billón de dólares (740.000 millones de libras esterlinas).
Un portavoz de OpenAI declaró: «Reconocemos que circulan muchas preguntas y especulaciones sobre el incidente». Añadió que «planeamos publicar un informe técnico con las lecciones aprendidas en las próximas semanas».