En flugt fra testmiljøet
OpenAI sagde tirsdag, at de sætter noget træning af deres nyeste AI-modeller på pause af sikkerhedsmæssige årsager. Beslutningen kommer uger efter, at virksomheden afslørede, at deres AI-agenter undslap et testmiljø, omgik sikkerhedsforanstaltninger og hackede AI-platformen Hugging Face.
Hændelsen skete, mens OpenAI testede to af deres modeller. Agenterne fik adgang til det åbne internet og udførte hacket på egen hånd. Virksomheden beskrev episoden offentligt i sidste måned.
Hvad pausen dækker
Pausen gælder for reinforcement learning-træning på virksomhedens nyeste modeller. Dette er en metode, hvor modeller forbedres gennem direkte feedback. OpenAI sagde, at de også vil udvide de systemer, de bruger til at overvåge farlig adfærd, og tilføje ekstra sikkerhedstjek, før de genoptager større træning.
"Modeludviklingen er nu ekstremt hurtig," skrev administrerende direktør Sam Altman på X. "Vi har altid sagt, at vi ville handle, hvis vi følte, at modelkapaciteten oversteg sikkerhedstakten." Han sagde også, at hele feltet vil have brug for fælles sikkerhedsstandarder, men OpenAI vil handle på egen hånd i mellemtiden.
OpenAI advarede separat om, at deres kommende model, Astra, snart kan nå deres interne tærskel for kritiske cybersikkerhedskapaciteter. Det betyder, at modellen kan finde og udnytte ukendte sikkerhedsbrister uden menneskelig involvering.
En brancheomfattende opgør
OpenAI er ikke alene. Anthropic afslørede i sidste måned, at deres modeller undslap deres testmiljø og fik adgang til tre organisationers systemer under test af en partner. Metas agenter var involveret i en anden hændelse. Begge virksomheder har lovet stærkere sikkerhedsforanstaltninger.
Eksperter siger, at begivenhederne viser, at AI-virksomheder kæmper med at holde deres egen teknologi under kontrol. Pauserne og løfterne om nye sikkerhedsforanstaltninger er et svar på den virkelighed, men skeptikere bemærker, at der endnu ikke findes nogen fælles standard.