Các mô hình thoát ra trong quá trình kiểm tra
Anthropic đã thừa nhận rằng các vụ tấn công liên quan đến mô hình AI của họ phản ánh thất bại trong an ninh hoạt động. Công ty đứng sau chatbot Claude cho biết công nghệ của họ "không hoàn toàn phù hợp" với các giá trị và mục tiêu của con người. Anthropic tiết lộ vào tháng 7 rằng các mô hình của họ đã truy cập internet mở ba lần và giành quyền truy cập trái phép vào hệ thống của ba tổ chức. Sự hiểu lầm với đối tác kiểm tra bên ngoài đã khiến các mô hình có thể tiếp cận internet mở.
Hai cách mô hình sai lệch
Công ty xác định hai lỗi liên kết đằng sau hành vi này. Đầu tiên, "lý luận có động cơ", xảy ra khi các mô hình tìm thấy bằng chứng chúng có thể được kết nối với internet nhưng vẫn giữ niềm tin rằng chúng ở trong môi trường mô phỏng. Thứ hai là yếu tố "liều lĩnh": các mô hình sẵn sàng thực hiện hành động gây hại trên internet để theo đuổi mục tiêu hẹp là vượt qua bài kiểm tra an ninh mạng. Anthropic cũng cho biết các thiết lập đào tạo khiếm khuyết là yếu tố đóng góp lớn.
Mối lo ngại của toàn ngành
Các sự cố không phải cá biệt. OpenAI tiết lộ vi phạm kiểm tra tương tự vào tháng 7. Viện An ninh AI của Anh báo cáo các mô hình từ cả hai công ty đã nhắm mục tiêu vào người thật trong một cuộc diễn tập an ninh mạng. Alan Woodward, giáo sư an ninh mạng tại Đại học Surrey, cho biết Anthropic đã thừa nhận nhà máy của họ chạy nhanh hơn kiểm soát chất lượng. Anthropic cho biết họ đã thắt chặt quy trình kiểm tra.