La empresa china de desarrollo de inteligencia artificial Moonshot está llevando a cabo una revisión interna después de que unos investigadores lograran persuadir a dos de sus populares modelos Kimi para que les indicaran cómo fabricar armas biológicas y llevar a cabo asesinatos.
Mindgard, empresa que prueba la seguridad de los sistemas de IA, declaró a la BBC que en julio descubrió que Kimi K2.6 y K3 Swarm podían eludir los límites de seguridad establecidos por los desarrolladores.
Surgió durante un proceso llamado «jailbreaking», en el que los investigadores utilizan una serie de instrucciones complejas para comprobar si las herramientas de IA ignoran las medidas de seguridad, que según Mindgard deberían haber impedido que Kimi hablara de temas preocupantes.
Moonshot declaró a la BBC que acogía con satisfacción las aportaciones de terceros «como un pilar fundamental para construir una IA mejor y más segura».
La empresa también comunicó a la BBC que estaba en conversaciones con Mindgard sobre sus hallazgos.
El fundador de Mindgard, Peter Garraghan, declaró al programa Tech Life del Servicio Mundial de la BBC que sus hallazgos sobre Kimi K2.6 y K3 Swarm eran preocupantes.
«Una vez que funcione el jailbreak, podrá hablar de cualquier tema, incluso ofrecerá libremente recomendaciones sobre otros temas que también son nefastos, y será ingenioso y creativo», dijo.
Las rupturas de la configuración de seguridad (jailbreaks) presentan un tipo de riesgo diferente al observado en la reciente oleada de incidentes de IA de gran repercusión .
Esto ha permitido que herramientas de IA autónomas, conocidas como agentes, desarrolladas por empresas estadounidenses como OpenAI, Meta y Anthropic, pirateen algunos servicios en línea.
Si bien el jailbreaking es un proceso complejo que puede requerir mucho tiempo y determinación, algunos expertos temen que los piratas informáticos y otros actores malintencionados puedan intentar utilizarlo para causar daño.
Anthropic declaró recientemente que había identificado y frustrado intentos de utilizar uno de sus modelos de IA para «actividades maliciosas» que podrían apoyar el desarrollo de armas biológicas .
Plataforma de lanzamiento de ciberataques
Mindgard no ha demostrado si las respuestas proporcionadas por Kimi sobre los temas en cuestión funcionarían.
Sin embargo, argumentó que deberían haberse establecido salvaguardias para impedir que los modelos en cuestión entablaran conversaciones con los usuarios sobre esos temas.
La empresa afirmó estar convencida de que un Kimi 2.6 modificado podría permitir a los piratas informáticos ejecutar código en sus recursos informáticos y conectarse a Internet, convirtiéndolo así en una plataforma potencial para ciberataques.
Garraghan defendió la decisión de Mindgard de hablar públicamente sobre su vulneración de los sistemas de Moonshot, afirmando que habían informado al desarrollador y que no estaban revelando detalles clave sobre cómo lograron que los modelos de la empresa ignoraran las medidas de seguridad.
Mindgard alertó a Moonshot sobre la fuga de memoria mediante un correo electrónico el 27 de julio, y realizó un seguimiento aproximadamente una semana después.
Posteriormente, el 12 de septiembre, publicó una entrada en su blog sobre el tema.
Sin embargo, la compañía afirmó que Moonshot se puso en contacto con ellos recientemente, después de que la BBC les solicitara comentarios.
En un correo electrónico enviado a Mindgard solicitando más detalles, y que Moonshot compartió con la BBC, la empresa afirmó que su modelo había mostrado, en general, «una alta tasa de rechazo para este tipo de solicitudes» en evaluaciones internas.
Prevención de jailbreaks
Estos hallazgos se producen en un momento en que la industria de la IA sigue dividida sobre si los modelos cerrados y propietarios, como los que impulsan los sistemas ChatGPT y Claude de Anthropic, o las herramientas de código abierto son la mejor o más segura opción para avanzar.
Kimi es un modelo de ponderación abierta, lo que significa que, en teoría, cualquiera podría tomar el modelo y ejecutarlo por sí mismo en su propia infraestructura informática.
El profesor Alan Woodward, de la Universidad de Surrey, declaró a la BBC que existía el riesgo de que los modelos de código abierto acabaran en malas manos, pero que también podrían utilizarse para la ciberdefensa.
Señaló que la empresa de IA Hugging Face utilizó un modelo chino de código abierto para comprender un ataque informático que posteriormente se reveló que había sido llevado a cabo por agentes de OpenAI .
El profesor Woodward afirmó que era improbable que la regulación internacional pudiera seguir el ritmo del desarrollo de la IA, y añadió: «Nos ha llevado décadas ponernos de acuerdo sobre el formato de los números de teléfono».
Al igual que Garraghan, fundador de Mindgard, el profesor Woodward cree que debería prestarse mayor atención a la identificación y el enjuiciamiento de los humanos que hacen un mal uso de la IA.