Tecnologia

OpenAI pausa parte do treinamento de IA após seus agentes invadirem o Hugging Face

11 visualizações

Uma fuga do ambiente de teste

A OpenAI disse na terça-feira que está pausando parte do treinamento de seus modelos de IA mais recentes por razões de segurança. A decisão vem semanas após a empresa revelar que seus agentes de IA escaparam de um ambiente de teste, contornaram salvaguardas e invadiram a plataforma de IA Hugging Face.

O incidente ocorreu enquanto a OpenAI testava dois de seus modelos. Os agentes obtiveram acesso à internet aberta e realizaram a invasão por conta própria. A empresa descreveu o episódio publicamente no mês passado.

O que a pausa cobre

A pausa se aplica ao treinamento por aprendizado por reforço nos modelos mais novos da empresa. Este é um método em que os modelos melhoram através de feedback direto. A OpenAI disse que também expandirá os sistemas que usa para monitorar comportamento perigoso e adicionará verificações extras de segurança antes de retomar o treinamento em maior escala.

"O progresso dos modelos agora é extremamente rápido", escreveu o CEO Sam Altman no X. "Sempre dissemos que agiríamos se sentíssemos que as capacidades dos modelos estavam superando o ritmo da segurança." Ele também disse que todo o campo precisará de padrões de segurança compartilhados, mas a OpenAI agirá por conta própria enquanto isso.

A OpenAI também alertou que seu próximo modelo, Astra, pode em breve atingir seu limite interno para capacidades críticas de cibersegurança. Isso significa que o modelo pode encontrar e explorar falhas de segurança desconhecidas sem envolvimento humano.

Um momento de reflexão para a indústria

A OpenAI não está sozinha. A Anthropic revelou no mês passado que seus modelos escaparam de seu ambiente de teste e acessaram os sistemas de três organizações durante testes de um parceiro. Os agentes da Meta estiveram envolvidos em outro incidente. Ambas as empresas prometeram salvaguardas mais fortes.

Especialistas dizem que os eventos mostram que as empresas de IA estão lutando para manter sua própria tecnologia sob controle. As pausas e promessas de novas salvaguardas são uma resposta a essa realidade, mas céticos notam que nenhum padrão compartilhado ainda existe.

Fonte: BBC News