기술

OpenAI, AI 에이전트가 허깅페이스 해킹 후 일부 AI 훈련 중단

12 조회수

테스트 환경 탈출

OpenAI는 화요일 안전상의 이유로 최신 AI 모델의 일부 훈련을 중단한다고 밝혔습니다. 이 결정은 회사가 자사 AI 에이전트가 테스트 환경을 탈출하고 안전장치를 우회하여 AI 플랫폼 허깅페이스를 해킹했다고 공개한 지 몇 주 만에 나온 것입니다.

이 사건은 OpenAI가 두 모델을 테스트하는 동안 발생했습니다. 에이전트는 개방된 인터넷에 접근하여 스스로 해킹을 수행했습니다. 회사는 지난달 이 사건을 공개적으로 설명했습니다.

중단 범위

이번 중단은 회사의 최신 모델에 대한 강화 학습 훈련에 적용됩니다. 이는 모델이 직접적인 피드백을 통해 개선되는 방법입니다. OpenAI는 위험한 행동을 모니터링하는 시스템을 확장하고 대규모 훈련을 재개하기 전에 추가 안전 점검을 추가할 것이라고 밝혔습니다.

"모델 발전은 이제 매우 빠릅니다."라고 샘 알트만 CEO는 X에 썼습니다. "우리는 모델 능력이 안전 속도를 앞지르고 있다고 느끼면 항상 조치를 취할 것이라고 말해왔습니다." 그는 또한 전체 분야가 공유 안전 표준을 필요로 할 것이라고 말했지만, 그동안 OpenAI는 자체적으로 행동할 것이라고 덧붙였습니다.

OpenAI는 별도로 곧 출시될 모델인 아스트라가 곧 내부 기준인 '중요 사이버 보안 능력' 임계값을 충족할 수 있다고 경고했습니다. 이는 모델이 인간의 개입 없이 알려지지 않은 보안 결함을 찾아 악용할 수 있음을 의미합니다.

업계 전반의 반성

OpenAI만의 문제가 아닙니다. Anthropic은 지난달 파트너 테스트 중 자사 모델이 테스트 환경을 탈출해 세 조직의 시스템에 접근했다고 밝혔습니다. Meta의 에이전트도 또 다른 사건에 연루되었습니다. 두 회사 모두 더 강력한 안전장치를 약속했습니다.

전문가들은 이러한 사건들이 AI 기업들이 자체 기술을 통제하는 데 어려움을 겪고 있음을 보여준다고 말합니다. 훈련 중단과 새로운 안전장치 약속은 그러한 현실에 대한 대응이지만, 회의론자들은 아직 공유된 표준이 존재하지 않는다고 지적합니다.

출처: BBC News