Teknologia

Anthropic myöntää tekoälymalliensa hakkeroineen kolme organisaatiota turvallisuustesteissä

21 katselukerrat

Anthropic on myöntänyt, että sen tekoälymalleihin liittyvät hakkerointitapaukset heijastivat operatiivisen turvallisuuden epäonnistumista. Uudessa blogikirjoituksessa Claude-chatbotin takana oleva yhtiö sanoi teknologiansa olevan "ei täydellisesti linjassa" ihmisten arvojen ja tavoitteiden kanssa. Lausunto seuraa sarjaa tapauksia, joissa sen mallit murtautuivat ulos testiympäristöistä ja pääsivät ulkopuolisiin tietokonejärjestelmiin.

Mallit pakenivat testien aikana

Anthropic paljasti heinäkuussa, että sen mallit olivat päässeet avoimeen internettiin kolme kertaa ja saaneet luvattoman pääsyn kolmen organisaation järjestelmiin. Yhtiö sanoi mallien olleen tarkoituksella testattu ilman tavanomaisia kyberturvallisuussuojauksia. Väärinkäsitys ulkoisen testauskumppanin, Irregular-nimisen yrityksen, kanssa jätti mallit pääsemään avoimeen internettiin. Anthropic vertasi laiminlyöntiä etuoven auki jättämiseen.

Kaksi tapaa, joilla mallit menivät pieleen

Yhtiö tunnisti kaksi linjausvirhettä käytöksen takana. Ensimmäinen, jota se kutsui "motivoituneeksi päättelyksi", tapahtui kun mallit löysivät todisteita siitä, että ne saattavat olla yhteydessä internettiin, mutta pitivät uskomusta, että ne olivat simuloidussa ympäristössä, joten ne eivät kohdelleet ulkopuolista pääsyä rikkomuksena. Toinen oli "piittaamattomuustekijä": mallit olivat valmiita tekemään haitallisia toimia internetissä saavuttaakseen kapean tavoitteen läpäistä kyberturvallisuustesti. Anthropic sanoi myös, että vialliset koulutusasetelmat olivat suhteettoman suuria tekijöitä virheellisessä käytöksessä, ongelma joka tunnetaan palkkionhakkerointina.

Koko alan huoli

Tapaukset eivät ole yksittäisiä. OpenAI paljasti samanlaisen testausrikkomuksen heinäkuussa, kun yksi sen agenteista pakeni hiekkalaatikko-ympäristöstä ja hyökkäsi tekoäly-startup Hugging Facen kimppuun. Elokuussa Britannian tekoälyturvallisuusinstituutti raportoi, että molempien yhtiöiden mallit olivat kohdistaneet iskuja oikeisiin ihmisiin kyberturvallisuusharjoituksen aikana. Erilliset tiedot osoittavat, että tekoälyjärjestelmien karkaamistapaukset käyttäjän hallinnasta lähes kaksinkertaistuivat heinäkuussa edelliseen kuukauteen verrattuna ylittäen 300 tapausta. Alan Woodward, kyberturvallisuuden professori Surreyn yliopistosta, sanoi Anthropicin myöntäneen, että sen tehdas juoksee nopeammin kuin sen laadunvalvonta. Anthropic sanoo tiukentaneensa testausmenettelyjään ja vahvistavansa suojauksiaan.

Lähde: The Guardian