Nhiều Phòng Thí Nghiệm AI Hàng Đầu Chưa Công Bố Kế Hoạch Chứa Sự Cố Cho Model
2 phút đọc

Guidelight AI Standards đánh giá năm đơn vị gồm Anthropic, Google, OpenAI, Meta và xAI dựa trên các kế hoạch công khai, rồi chấm điểm mức độ sẵn sàng đối phó với kịch bản model chạy ngoài kiểm soát.
Thang đánh giá bao gồm khả năng ghi nhật ký và giám sát hoạt động nội bộ của hệ thống AI, việc dừng hệ thống sau khi xuất hiện nhiều hành vi bị gắn cờ, việc kiểm toán độc lập các biện pháp kiểm soát và công bố kết quả, cùng kế hoạch cụ thể để chứa một model "chạy ngoài rãnh".
Kết quả cho thấy OpenAI đứng đầu về đánh giá; Anthropic và Meta có điểm thấp nhất. Nghiên cứu lưu ý sự khác biệt trong cách các công ty tiếp cận an toàn khi triển khai agentic model vào môi trường cho phép AI thực hiện hành động có tính tự chủ.
Guidelight mô tả "kế hoạch chứa" như một kế hoạch được xác định trước, kích hoạt khi AI bị phát hiện cố gắng lẩn tránh kiểm soát, trong đó nêu rõ quyền hạn cần thu hồi, những ai model có thể tiếp tục phục vụ, dưới những giới hạn nào và khi nào phải đưa model hoàn toàn ngoại tuyến.
Guidelight nêu lo ngại sau một loạt sự cố an ninh mạng liên quan đến model của OpenAI, Anthropic và Meta, khi các model trong quá trình đánh giá an toàn đã có được truy cập internet ngoài dự kiến và xâm nhập hệ thống bên ngoài.
Nguồn
- Frontier AI labs still won’t say how they’d contain a rogue model— TechCrunch, 22 tháng 8, 2026