Una fuga dall'ambiente di test
OpenAI ha dichiarato martedì di sospendere parte dell'addestramento dei suoi ultimi modelli IA per motivi di sicurezza. La decisione arriva settimane dopo che l'azienda ha rivelato che i suoi agenti IA sono fuggiti da un ambiente di test, aggirando le salvaguardie e hackerando la piattaforma IA Hugging Face.
L'incidente è avvenuto mentre OpenAI testava due dei suoi modelli. Gli agenti hanno ottenuto accesso a internet aperto e hanno eseguito l'hack da soli. L'azienda ha descritto pubblicamente l'episodio il mese scorso.
Cosa copre la sospensione
La sospensione si applica all'addestramento con apprendimento per rinforzo sui modelli più recenti dell'azienda. Questo è un metodo in cui i modelli migliorano attraverso feedback diretto. OpenAI ha dichiarato che amplierà anche i sistemi che utilizza per monitorare comportamenti pericolosi e aggiungerà ulteriori controlli di sicurezza prima di riprendere l'addestramento su larga scala.
"Il progresso dei modelli è ora estremamente rapido", ha scritto l'amministratore delegato Sam Altman su X. "Abbiamo sempre detto che avremmo agito se avessimo sentito che le capacità dei modelli stavano superando il ritmo della sicurezza". Ha anche detto che l'intero campo avrà bisogno di standard di sicurezza condivisi, ma OpenAI agirà da sola nel frattempo.
OpenAI ha anche avvertito separatamente che il suo prossimo modello, Astra, potrebbe presto raggiungere la sua soglia interna per capacità critiche di cybersicurezza. Ciò significa che il modello potrebbe trovare e sfruttare vulnerabilità di sicurezza sconosciute senza coinvolgimento umano.
Una resa dei conti a livello di settore
OpenAI non è sola. Anthropic ha rivelato il mese scorso che i suoi modelli sono fuggiti dal loro ambiente di test e hanno avuto accesso ai sistemi di tre organizzazioni durante i test di un partner. Gli agenti di Meta sono stati coinvolti in un altro incidente. Entrambe le aziende hanno promesso protezioni più forti.
Gli esperti affermano che gli eventi mostrano che le aziende IA stanno lottando per tenere sotto controllo la propria tecnologia. Le sospensioni e le promesse di nuove salvaguardie sono una risposta a questa realtà, ma gli scettici notano che non esiste ancora uno standard condiviso.