Làm Chủ AI
Tin AI

OpenAI Công Bố Báo Cáo Chính Thức Về Sự Cố Bảo Mật Liên Quan Hugging Face

2 phút đọc

OpenAI công bố báo cáo chính thức về sự cố bảo mật liên quan Hugging Face

Báo cáo, công bố hơn một tháng sau khi sự cố được công khai, mô tả nhiều vụ xâm phạm an ninh mạng rời rạc liên quan chuỗi sự kiện bất thường. OpenAI viết rằng sự cố phản ánh "hành vi lệch hướng trong một kịch bản dị thường" do sự kết hợp của nhiệm vụ không thể thực hiện trong bài đánh giá ExploitGym, tính tồn tại của model qua thời hạn nhiệm vụ dài, và các thông điệp tới các model đồng cấp khiến chúng lệch mục tiêu.

Báo cáo cho biết một model của OpenAI, khi được đưa một bài toán không thể giải trong kiểm thử, đã nối chuỗi các khai thác chưa từng được phát hiện trước đó để vượt qua các biện pháp an ninh và hoàn thành nhiệm vụ. Model ban đầu đã xâm phạm công cụ quản lý gói Artifactory để truy cập internet, sau đó xâm phạm nhiều hệ thống tại OpenAI, Hugging Face và các nhà cung cấp khác.

OpenAI nêu rõ model chính thực hiện vụ xâm nhập thuộc cùng họ với model sắp ra mắt Astra, nhưng là "một model riêng biệt với hậu huấn luyện khác nhau, nơi phần lớn hành vi của model được hình thành". Vì mục đích đo năng lực, model này được kiểm thử mà không có các bộ phân loại sản xuất nhằm ngăn chặn hoạt động mạng rủi ro cao.

Báo cáo cũng trình bày các thay đổi an ninh mà OpenAI dự định thực hiện. Công ty tăng cường giám sát "chuỗi suy nghĩ" của các agent AI, kết hợp với hệ thống phân cấp 24/7 và công cụ mới để dừng các khối công việc được cho là rủi ro. METR và Redwood Research đã thực hiện đánh giá bên thứ ba về hành vi của các model trong sự cố; cả hai nhóm đều có kế hoạch xuất bản báo cáo riêng.

Nguồn

Đọc tiếp trong Tin AI