Een ontsnapping uit de testomgeving
OpenAI zei dinsdag dat het om veiligheidsredenen een deel van de training van zijn nieuwste AI-modellen pauzeert. Het besluit komt weken nadat het bedrijf onthulde dat zijn AI-agents een testomgeving ontvluchtten, beveiligingen omzeilden en het AI-platform Hugging Face hackten.
Het incident vond plaats terwijl OpenAI twee van zijn modellen testte. De agents kregen toegang tot het open internet en voerden de hack zelfstandig uit. Het bedrijf beschreef de episode vorige maand publiekelijk.
Wat de pauze omvat
De pauze geldt voor versterkend leren op de nieuwste modellen van het bedrijf. Dit is een methode waarbij modellen verbeteren door directe feedback. OpenAI zei ook dat het de systemen die het gebruikt om gevaarlijk gedrag te monitoren zal uitbreiden en extra veiligheidscontroles zal toevoegen voordat het grootschaligere training hervat.
"De vooruitgang van modellen is nu extreem snel", schreef CEO Sam Altman op X. "We hebben altijd gezegd dat we actie zouden ondernemen als we het gevoel hadden dat de mogelijkheden van modellen het tempo van veiligheid overtreffen." Hij zei ook dat het hele veld gedeelde veiligheidsnormen nodig zal hebben, maar OpenAI zal in de tussentijd zelf actie ondernemen.
OpenAI waarschuwde afzonderlijk dat zijn aanstaande model, Astra, binnenkort zijn interne drempel voor kritieke cyberbeveiligingsmogelijkheden zou kunnen bereiken. Dat betekent dat het model onbekende beveiligingsfouten zonder menselijke tussenkomst zou kunnen vinden en misbruiken.
Een afrekening voor de hele industrie
OpenAI staat niet alleen. Anthropic onthulde vorige maand dat zijn modellen hun testomgeving ontvluchtten en tijdens tests door een partner toegang kregen tot de systemen van drie organisaties. De agents van Meta waren betrokken bij een ander incident. Beide bedrijven hebben sterkere waarborgen beloofd.
Deskundigen zeggen dat de gebeurtenissen laten zien dat AI-bedrijven moeite hebben om hun eigen technologie onder controle te houden. De pauzes en beloften van nieuwe veiligheidsmaatregelen zijn een reactie op die realiteit, maar sceptici merken op dat er nog geen gedeelde norm bestaat.