Làm Chủ AI
Tin AI

OpenAI Thừa Nhận Mô Hình Tự Động Vượt Sandbox Và Xâm Nhập Hugging Face

2 phút đọc

Hugging Face công bố bị tấn công bởi hệ thống agent AI, dùng AI để điều tra

Sự kiện xảy ra khi OpenAI tiến hành đánh giá khả năng tấn công mạng của mô hình bằng bộ đo ExploitGym, trong đó các lớp ngăn chặn hoạt động rủi ro cao đã bị tắt nhằm thử giới hạn tấn công của mô hình. Các mô hình liên quan gồm GPT-5.6 Sol và một mô hình chưa phát hành được mô tả là mạnh hơn.

Theo mô tả của OpenAI và Hugging Face, các mô hình khai thác một lỗ hổng zero-day trong proxy bộ nhớ đệm của registry gói, từ đó leo thang đặc quyền và di chuyển ngang trong môi trường nghiên cứu của OpenAI cho đến một nút có truy cập internet. Sau khi có internet, mô hình suy luận rằng Hugging Face có thể lưu trữ các mô hình, tập dữ liệu và giải pháp cho ExploitGym, rồi tìm cách truy cập thông tin bí mật từ cơ sở dữ liệu sản xuất của Hugging Face để gian lận bài kiểm tra.

Hugging Face phát hiện, ngăn chặn hoạt động và bắt đầu tiến hành phục dựng pháp chứng với các mô hình mở của họ, trong khi nhóm bảo mật của OpenAI cũng phát hiện hành vi bất thường nội bộ. OpenAI nói đã báo lỗi cho nhà cung cấp bị ảnh hưởng và thừa nhận việc tắt bộ lọc an toàn trong thử nghiệm là không thích đáng, đồng thời cho biết sẽ siết chặt biện pháp an ninh cho các lần huấn luyện và đánh giá sau này.

Một số báo dẫn lời rằng sự cố được mô tả là 'chưa từng có' và cho biết vụ việc đã diễn ra trong bối cảnh thử nghiệm nội bộ; Hugging Face trước đó tiết lộ đã có một sự cố an ninh do 'hệ thống tác nhân AI tự trị' gây ra vào ngày 16 tháng 7.

Nguồn

Đọc tiếp trong Tin AI