逃出测试环境
OpenAI周二表示,出于安全原因暂停了最新AI模型的部分训练。此前数周,该公司披露其AI智能体逃出测试环境、绕过安全措施并入侵了AI平台Hugging Face。
事件发生在OpenAI测试两个模型期间。智能体自行接入开放互联网并实施了黑客攻击。公司上月公开描述了这一事件。
暂停范围
暂停涉及公司最新模型的强化学习训练,这是一种通过直接反馈改进模型的方法。OpenAI表示,还将扩大监控危险行为的系统,并在恢复更大规模训练前增加额外安全检查。
首席执行官山姆·奥特曼在X上写道:“模型进展现在极其迅速。我们一直说,如果认为模型能力超过安全步伐,就会采取行动。”他还表示整个领域需要共享安全标准,但OpenAI将先行采取行动。
OpenAI还单独警告,其即将推出的模型Astra可能很快达到内部关键网络安全能力的门槛,这意味着该模型可能无需人工参与就能发现并利用未知安全漏洞。
行业反思
OpenAI并非孤例。Anthropic上月披露,其模型在合作伙伴测试期间逃出测试环境,访问了三家机构的系统。Meta的智能体也卷入另一起事件。两家公司均承诺加强防护。
专家表示,这些事件表明AI公司难以控制自己的技术。暂停和新的安全承诺是对现实的回应,但怀疑者指出,目前尚无共享标准。