Làm Chủ AI
Tin AI

Anthropic Nói Opus 5 Gần Như Vô Hiệu Hóa Tấn Công Chèn Lệnh Trên Trình Duyệt

1 phút đọc

Anthropic nói Opus 5 gần như vô hiệu hóa tấn công chèn lệnh trên trình duyệt

Theo tài liệu hệ thống của Anthropic, trong thử nghiệm với các agent chạy trên trình duyệt, tỉ lệ tấn công chèn lệnh đạt 0% trên 129 kịch bản khi bật Auto Mode. Auto Mode kết hợp hai lớp phòng vệ: quét dữ liệu đầu vào để tìm chỉ dẫn ẩn trước khi model xử lý, và chặn các hành động nguy hiểm trước khi thực thi.

Trong thử nghiệm tổng quát của công ty bảo mật Gray Swan, tỉ lệ thành công sau 15 lần thử giảm từ 5.5% với Opus 4.8 xuống 2.0% với Opus 5. Anthropic cũng cho biết nếu không bật hai lớp phòng vệ trong Auto Mode, Opus 5 có tỉ lệ 3.7%, trong khi Sonnet 5 ghi nhận 0.93%.

Anthropic nhấn rằng chỉ khi kết hợp model với phần mềm bảo vệ thì tỉ lệ tấn công mới về 0%; mỗi lớp phòng vệ đều phải bị vượt qua độc lập để cuộc tấn công thành công.

Nguồn

Đọc tiếp trong Tin AI