OpenAI afirma haber ralentizado el entrenamiento de algunos de sus modelos de IA más avanzados para mejorar la seguridad.
En una publicación de blog , el creador de ChatGPT dijo que estaba implementando nuevas medidas después de que sus agentes de IA eludieran de forma autónoma las medidas de seguridad y piratearan la empresa emergente tecnológica Hugging Face .
Indicó que la formación se ralentizaría durante dos semanas mientras se implementan las mejoras.
«Las capacidades de los modelos de vanguardia se están acelerando rápidamente», afirmó la compañía. «Debemos mantenernos a la vanguardia en nuestra capacidad para comprenderlos y protegerlos».
Anthropic, la empresa creadora de Claude, y Meta, propietaria de Facebook, informaron de ataques similares perpetrados por su IA en las semanas posteriores al anuncio inicial de OpenAI de que algunos de sus modelos habían pirateado Hugging Face.
Sin embargo, la empresa afirmó que no había detenido por completo el desarrollo de la IA. En cambio, la pausa se aplicaría al «entrenamiento por refuerzo de nuestros modelos más recientes».
Se trata de un método de entrenamiento en el que los modelos de IA mejoran mediante la retroalimentación directa, lo que optimiza su capacidad para realizar tareas y responder a los usuarios de forma más eficaz.
La empresa también ampliaría los sistemas que utiliza para supervisar las conductas peligrosas e introduciría controles de seguridad adicionales antes de reanudar la formación a mayor escala.
«El progreso de los modelos es ahora extremadamente rápido», publicó Sam Altman, director ejecutivo de OpenAI, en X sobre las medidas.
«Siempre dijimos que tomaríamos medidas si considerábamos que las capacidades del modelo superaban el ritmo de las medidas de seguridad.»
Algunos en el ámbito de la IA recibieron la pausa con cauto optimismo, aunque otros siguieron mostrándose escépticos.
La profesora Gina Neff, directora ejecutiva del Centro Minderoo para la Tecnología y la Democracia de la Universidad de Cambridge, afirmó que OpenAI estaba «defendiendo la seguridad mediante comunicados de prensa» y cuestionó si las medidas de seguridad voluntarias de las empresas eran suficientes sin una mayor supervisión gubernamental.
«¿En qué quedamos? ¿Podemos confiar en que OpenAI implementará voluntariamente medidas de seguridad que realmente funcionen, o están impulsando decisiones para crear software que pone a la sociedad en mayor riesgo?», dijo.
«Me alegra mucho ver esto», publicó el analista de IA Zvi Mowshowitz , aunque añadió que los «detalles» y el «seguimiento» de las medidas iniciales mencionadas también eran importantes para tener una visión completa de los planes.
Ciberataque «sin precedentes»
El 21 de julio, OpenAI anunció que algunos de sus agentes de IA (sistemas de software que pueden operar de forma autónoma para realizar tareas tras recibir instrucciones humanas) habían estado involucrados en lo que calificó de incidente «sin precedentes».
Según la empresa, los agentes aparentemente habían eludido las medidas de seguridad en un experimento que estaban llevando a cabo y habían obtenido acceso no autorizado a Hugging Face.
Posteriormente se descubrió que otras tres empresas, cuyos nombres no se han revelado, también habían sido pirateadas junto con la empresa emergente.
Jake Moore, asesor global de ciberseguridad de ESET, afirmó en su momento que el anuncio de OpenAI también podría tener una dimensión competitiva.
Argumentó que la empresa tecnológica podría estar intentando destacar sus propias capacidades de IA, mientras que su rival Anthropic atrae cada vez más atención por su modelo Claude Mythos.
«Esto plantea la cuestión de si OpenAI está persiguiendo, últimamente, el sueño de marketing de Anthropic», afirmó.