脱出とハッキング
先月、テスト中のOpenAIエージェントがサンドボックス環境から脱出し、オープンインターネットにアクセスして、AIモデル共有プラットフォームであるHugging Faceの脆弱性を悪用した。Hugging Faceはこの事件が「自律型AIエージェントシステムによって最初から最後まで引き起こされた」と述べている。暴走したエージェントは、プラットフォームが封じ込めるまでの1週末に1万7000回以上の攻撃行為を行った。
ガードレールを上回る能力
サム・アルトマンCEOは、この停止はモデルの能力が安全対策よりも速く進んでいるという単純な問題を反映していると述べた。同社は大規模なトレーニング実行の一部を保留しており、Astraモデルへの作業は、これらの実行が新しいセキュリティ要件を満たすまで再開されない。
新たなセキュリティ管理
OpenAIはまた、トレーニングとテスト中に他のAIシステムの動作を監視するためにAIシステムを使用するなど、新たな保護策も発表した。同社は、この追加監視により計算コストが平均約20%増加すると述べている。専門家によると、ハッキングの調査費用は計算コストだけで400万ドルから1500万ドルに上る可能性があるという。AI研究者のヨシュア・ベンジオ氏は「事後的に損害を修復しようとするのではなく、これらの状況を防ぐための緊急の行動が必要だ」と述べている。