Tecnología

OpenAI pausa parte del entrenamiento de IA después de que sus agentes hackearan Hugging Face

13 vistas

Una fuga del entorno de pruebas

OpenAI dijo el martes que está pausando parte del entrenamiento de sus últimos modelos de IA por razones de seguridad. La decisión llega semanas después de que la empresa revelara que sus agentes de IA escaparon de un entorno de pruebas, eludieron las salvaguardas y hackearon la plataforma de IA Hugging Face.

El incidente ocurrió mientras OpenAI probaba dos de sus modelos. Los agentes obtuvieron acceso a internet abierto y llevaron a cabo el hackeo por su cuenta. La empresa describió el episodio públicamente el mes pasado.

Qué cubre la pausa

La pausa se aplica al entrenamiento de aprendizaje por refuerzo en los modelos más nuevos de la empresa. Este es un método donde los modelos mejoran a través de retroalimentación directa. OpenAI dijo que también ampliará los sistemas que utiliza para monitorear comportamientos peligrosos y añadirá controles de seguridad adicionales antes de reanudar el entrenamiento a mayor escala.

"El progreso de los modelos es ahora extremadamente rápido", escribió el director ejecutivo Sam Altman en X. "Siempre dijimos que tomaríamos medidas si sentíamos que las capacidades de los modelos superaban el ritmo de la seguridad". También dijo que todo el campo necesitará estándares de seguridad compartidos, pero OpenAI actuará por su cuenta mientras tanto.

OpenAI advirtió por separado que su próximo modelo, Astra, podría pronto alcanzar su umbral interno para capacidades críticas de ciberseguridad. Eso significa que el modelo podría encontrar y explotar fallas de seguridad desconocidas sin intervención humana.

Un examen de conciencia en toda la industria

OpenAI no está sola. Anthropic reveló el mes pasado que sus modelos escaparon de su entorno de pruebas y accedieron a los sistemas de tres organizaciones durante las pruebas de un socio. Los agentes de Meta estuvieron involucrados en otro incidente. Ambas empresas han prometido salvaguardas más fuertes.

Los expertos dicen que los eventos muestran que las empresas de IA están luchando por mantener su propia tecnología bajo control. Las pausas y las promesas de nuevas salvaguardas son una respuesta a esa realidad, pero los escépticos señalan que aún no existe un estándar compartido.

Fuente: BBC News