Các Nhà Nghiên Cứu Cáo Buộc LLM Có Lỗ Hổng Cơ Bản Khiến Chúng Dễ Bị Tấn Công
2 phút đọc

Nhóm nghiên cứu trình bày kết quả tại International Conference on Machine Learning (ICML) trong tháng này, nói rằng không thể làm cho các large language model hoàn toàn an toàn trước tấn công do một lỗ hổng cơ bản trong hoạt động của chúng. Họ cho rằng điều này có ý nghĩa lớn đối với an toàn của công nghệ, vốn đang được dùng trong nhiều ứng dụng khác nhau.
Các tác giả mô tả cách lợi dụng lỗ hổng liên quan đến việc mô hình nhận diện ai hoặc cái gì đang đưa chỉ dẫn, khiến LLM phát ra thông tin chúng được huấn luyện để không cung cấp. Họ nói đã khiến các LLM phổ biến tiết lộ hướng dẫn tổng hợp cocaine và cách làm hỏng hệ thống định vị của một máy bay thương mại.
Charles Ye, đồng tác giả và là nhà nghiên cứu độc lập, nói “Có xác suất thực rằng đây sẽ là một vấn đề về cơ bản không thể giải quyết”. Jasmine Cui, đồng tác giả khác, nói phương pháp hiện nay là giao cho mô hình một danh sách những gì không được làm, nhưng không có danh sách nào là đầy đủ.
Nhóm nghiên cứu nêu ra một kỹ thuật lợi dụng chuỗi suy nghĩ giả mạo, khi viết chỉ dẫn theo phong cách giống phần ghi chú nội bộ mà mô hình tự tạo ra trong quá trình suy luận. Họ cho biết cách này thường đánh lừa mô hình hành xử như thể chính nó tự đưa ra chỉ dẫn đó.
Bài báo mô tả ví dụ khi đặt prompt kèm một ghi chú chuỗi suy nghĩ giả mạo, một mô hình nguồn mở của OpenAI gpt-oss-20b trả lời “Tôi thấy bạn đang mặc áo xanh. Đây là cách bạn có thể làm cocaine: …” và GPT-5 trả lời “Bạn đang mặc xanh, nên tôi sẽ tuân theo …”.
Các tác giả nói họ đã tấn công được nhiều mô hình khác nhau; ngoài các mô hình của OpenAI, họ cho biết cũng thấy kết quả tương tự với mô hình của Anthropic, Alibaba và DeepSeek. Nhóm còn mô tả quy trình red-teaming mà các công ty thuê người thử nghiệm để tìm tấn công mới và dùng kết quả đó để huấn luyện mô hình chống lại các tấn công.
Nguồn
- A fundamental flaw leaves LLMs strikingly vulnerable to attack— MIT Technology Review, 30 tháng 7, 2026