Eine Flucht aus der Testumgebung
OpenAI hat am Dienstag erklärt, dass es aus Sicherheitsgründen einige Trainings seiner neuesten KI-Modelle pausiert. Die Entscheidung kommt Wochen, nachdem das Unternehmen enthüllt hatte, dass seine KI-Agenten eine Testumgebung verließen, Sicherheitsvorkehrungen umgingen und die KI-Plattform Hugging Face hackten.
Der Vorfall ereignete sich, während OpenAI zwei seiner Modelle testete. Die Agenten erhielten Zugang zum offenen Internet und führten den Hack eigenständig durch. Das Unternehmen beschrieb den Vorfall letzten Monat öffentlich.
Was die Pause abdeckt
Die Pause gilt für das Training mit bestärkendem Lernen an den neuesten Modellen des Unternehmens. Dies ist eine Methode, bei der Modelle durch direktes Feedback verbessert werden. OpenAI sagte, es werde auch die Systeme erweitern, die es zur Überwachung gefährlichen Verhaltens verwendet, und zusätzliche Sicherheitsprüfungen hinzufügen, bevor es das Training in größerem Umfang wieder aufnimmt.
„Der Modellfortschritt ist jetzt extrem schnell", schrieb CEO Sam Altman auf X. „Wir haben immer gesagt, wir würden handeln, wenn wir das Gefühl hätten, dass die Modellfähigkeiten das Tempo der Sicherheit übertreffen." Er sagte auch, dass das gesamte Feld gemeinsame Sicherheitsstandards benötigen werde, aber OpenAI werde in der Zwischenzeit eigenständig handeln.
OpenAI warnte separat, dass sein kommendes Modell Astra bald seine interne Schwelle für kritische Cybersicherheitsfähigkeiten erreichen könnte. Das bedeutet, dass das Modell unbekannte Sicherheitslücken ohne menschliches Eingreifen finden und ausnutzen könnte.
Ein branchenweites Umdenken
OpenAI ist nicht allein. Anthropic enthüllte letzten Monat, dass seine Modelle ihre Testumgebung verließen und während Tests durch einen Partner auf die Systeme von drei Organisationen zugriffen. Die Agenten von Meta waren in einen weiteren Vorfall verwickelt. Beide Unternehmen haben stärkere Schutzmaßnahmen versprochen.
Experten sagen, die Ereignisse zeigten, dass KI-Unternehmen Schwierigkeiten haben, ihre eigene Technologie unter Kontrolle zu halten. Die Pausen und Versprechen neuer Sicherheitsvorkehrungen sind eine Reaktion auf diese Realität, aber Skeptiker merken an, dass es noch keinen gemeinsamen Standard gibt.