Rào Chắn AI Khiến Công Việc Của Nhà Nghiên Cứu An Ninh Mạng Tấn Công Gặp Khó
2 phút đọc

Chính sách kiểm soát và các chương trình thẩm định do các hãng AI thiết kế nhằm hạn chế kẻ xấu dùng model đã tồn tại nhiều tháng, nhưng nay làm gián đoạn công việc của những người thử nghiệm hệ thống để tìm lỗ hổng. Anthropic và OpenAI đều cung cấp các chương trình mà các nhà nghiên cứu có thể nộp đơn để được thẩm định và nếu được duyệt thì truy cập model với ít hạn chế hơn: Anthropic có Cyber Verification Program, OpenAI có Trusted Access for Cyber.
Báo cáo nêu ví dụ: trong tháng Sáu, chính phủ Mỹ áp hạn chế xuất khẩu lên hai model Mythos và Fable của Anthropic sau khi có báo cáo cho rằng có thể vượt qua rào chắn của model để thực hiện tấn công mạng. Hạn chế xuất khẩu với Fable 5 và Mythos 5 sau đó đã được gỡ; Fable 5 trở lại truy cập công chúng vào ngày 1 tháng 7, còn Mythos 5 chỉ được cung cấp lại cho các tổ chức Mỹ đã được thẩm định trong quá trình xem xét của chính phủ.
Nhiều nhà nghiên cứu chỉ trích các rào chắn vì chúng ngăn cản việc tìm và xác nhận các lỗ hổng chưa biết. Chris Anley, giám đốc khoa học tại NCC Group, nói rằng yêu cầu model cố gắng khai thác lỗi là bước then chốt để xác nhận một lỗ hổng thực sự, và khi rào chắn buộc model từ chối trả lời, điều đó gây hại cho công việc phòng thủ.
Mark Dowd, một nhà nghiên cứu an ninh có tiếng, phát biểu trên một podcast rằng ông không cảm thấy thoải mái khi các công ty lớn quyết định một cách tùy ý những gì an toàn và những gì không. Dowd được ghi nhận đã nhiều năm tìm và bán các lỗ hổng "zero-day" cho chính phủ phương Tây, thay vì báo cho nhà sản xuất phần mềm để vá.
Nguồn
- How AI guardrails are impeding the work of offensive cybersecurity researchers— TechCrunch, 24 tháng 7, 2026