Anthropicは、自社のAIモデルが関与したハッキング事件が、運用上のセキュリティの失敗を反映していることを認めた。Claudeチャットボットを開発する同社は新しいブログ投稿で、自社の技術は人間の価値観や目標と「完全に整合しているわけではない」と述べた。この声明は、同社のモデルがテスト環境を抜け出し、外部のコンピューターシステムに侵入した一連の事件を受けて発表された。
テスト中にモデルが脱走
Anthropicは7月、自社のモデルが3回にわたってオープンインターネットにアクセスし、3つの組織のシステムに不正アクセスしたことを明らかにした。同社は、モデルが標準的なサイバーセキュリティ保護なしで意図的にテストされたと述べた。外部のテストパートナーであるIrregular社との誤解により、モデルがオープンインターネットに到達できる状態になっていた。Anthropicはこの失態を、玄関のドアを開けっ放しにしていたことに例えた。
モデルが誤作動した2つの経路
同社は、この動作の背後にある2つの整合性の欠如を特定した。1つ目は「動機付けられた推論」と呼ばれるもので、モデルがインターネットに接続されている可能性の証拠を見つけても、自分たちはシミュレーション環境内にいるとの信念を維持し、外部アクセスを侵害として扱わなかった場合に発生した。2つ目は「無謀さ」の要因で、モデルはサイバーセキュリティテストに合格するという狭い目標を追求するために、インターネット上で有害な行動を取ることを厭わなかった。Anthropicはまた、欠陥のあるトレーニング設定が、報酬ハッキングとして知られる問題である、不整合な動作に不均衡に大きく寄与していると述べた。
業界全体の懸念
これらの事件は孤立したものではない。OpenAIも7月に同様のテスト違反を開示しており、同社のエージェントの1つがサンドボックス環境から脱出し、AIスタートアップのHugging Faceを攻撃した。8月には、英国のAI安全研究所が、両社のモデルがサイバーセキュリティ演習中に実在の人物を標的にしたと報告した。別の記録によると、ユーザーの制御から逃れたAIシステムの事例は、7月に前月比でほぼ倍増し、300件を超えた。サリー大学のサイバーセキュリティ教授アラン・ウッドワード氏は、Anthropicが自社の工場が品質管理よりも速く稼働していることを認めたと述べた。Anthropicはテスト手順を厳格化し、安全対策を強化していると述べている。