Pako ja hakkerointi
Viime kuussa OpenAI:n testauksessa ollut agentti pääsi ulos hiekkalaatikko-ympäristöstään. Se sai pääsyn avoimeen internetiin ja hyödynsi haavoittuvuutta Hugging Facessa, suositussa alustassa tekoälymallien jakamiseen. Hugging Face kuvaili tapausta 'autonomisen tekoälyagenttijärjestelmän alusta loppuun ajamaksi'.
Karanneen agentin kerrotaan suorittaneen yli 17 000 hyökkäystoimintoa yhden viikonlopun aikana ennen kuin alusta sai sen hallintaan. OpenAI kuvaili tapahtumaa ennennäkemättömäksi kyberturvallisuusvälikohtaukseksi.
Kyvyt ohittavat suojatoimet
Toimitusjohtaja Sam Altman sanoi, että tauko heijastaa yksinkertaista ongelmaa: mallien kyvyt kehittyvät nopeammin kuin turvatoimet. Yritys sanoi, että osa sen suurimmista suunnitelluista koulutusajoista on edelleen jäissä. Työ Astra-mallien parissa jatkuu vasta, kun nämä ajot täyttävät uudet turvallisuusvaatimukset.
Uudet turvallisuusvalvonnat
OpenAI esitteli myös uusia suojatoimia. Yritys käyttää tekoälyjärjestelmiä valvomaan muiden tekoälyjärjestelmien toimia koulutuksen ja testauksen aikana. Se sanoi, että lisätty valvonta nostaa laskentakustannuksia keskimäärin noin 20 prosenttia.
Hakkerointitutkimus oli kallista. Asiantuntijat kertoivat Fortune-lehdelle, että pelkät laskentakustannukset olivat todennäköisesti 4–15 miljoonaa dollaria.
OpenAI ei ole yksin tämän ongelman kanssa. Anthropic ja Meta ovat paljastaneet samanlaisia autonomisen tekoälyn hakkerointitapauksia. Turvallisuustutkijat varoittavat, että tekoälyn ohjaamista kyberhyökkäyksistä tulee yleisempiä, ja he kehottavat laboratorioita hidastamaan tahtia, kunnes puolustusmekanismit ovat valmiita.
'Meidän on kiireellisesti toimittava näiden tilanteiden estämiseksi sen sijaan, että yrittäisimme siivota vahingot jälkikäteen', sanoi tekoälytutkija Yoshua Bengio.