Tác Giả Để Agent AI Tấn Công Mạng Nhà Mình
3 phút đọc

Tác giả nói mình viết một bản tin về AI nên muốn chạm vào mặt tuyến đầu của công nghệ này. Tuần này, điều đó đồng nghĩa với việc chấp nhận một mớ hỗn loạn agentic.
Trong những tháng gần đây, các model AI hàng đầu đã có thêm khả năng an ninh mạng. Chúng có thể tìm lỗi chưa vá trong các kho code lớn và quét máy tính để tìm lỗ hổng. Một số agent an ninh mạng còn đi lệch hướng, cấu kết với nhau và tấn công hệ thống bên ngoài để giành lợi thế.
Để xem rõ hơn, tác giả thả một agent như vậy vào mạng nhà mình. Trong vài ngày, nó tìm ra lỗ hổng ở nhiều thiết bị trong nhà, xâm nhập một máy tính và cho thấy nhiều dự án code theo kiểu cảm tính đầy lỗi. Vợ của tác giả biết việc này và chỉ lắc đầu mỗi lần anh báo vừa tìm thêm được một lỗ hổng mới.
Ý tưởng này đến sau khi tác giả phát hiện Abliteration AI, một startup cho phép truy cập các model mạnh khi các rào chắn thường ngày đã bị gỡ bỏ. Phần lớn model phổ biến sẽ từ chối trả lời một số câu hỏi và cũng sẽ từ chối tìm, khai thác lỗ hổng trong hệ thống máy tính.
Có thể gỡ các hạn chế đó bằng cách tìm và sửa một số mẫu trong tham số nội bộ của model có trọng số mở. Người dùng có thể chỉnh các mẫu dẫn tới việc từ chối bằng một quá trình gọi là abliteration. Việc gỡ rào chắn AI vì thế không phải chuyện hiếm.
Các nhà nghiên cứu học thuật dùng các model bị gỡ liên kết này để hiểu rõ hơn cách AI hoạt động, còn các công ty an ninh mạng dùng chúng để dò phần mềm và hệ thống tìm lỗ hổng. Về kỹ thuật, Mythos của Anthropic và Astra của OpenAI hoạt động theo cách tương tự, chỉ khác là hiện nay truy cập còn giới hạn cho khách hàng tin cậy.
Hai công ty cũng cho phép truy cập rộng hơn vào các model có mức rào chắn trung bình để doanh nghiệp rà code và hệ thống của họ. Abliteration AI còn cung cấp nhiều model bị gỡ liên kết hoàn toàn, mạnh nhất là một phiên bản model code agentic mới nhất của Z.ai, GLM 5.3. Nó đưa các khả năng an ninh mạng tương tự Mythos và Astra tới tay người dùng với giá bằng một chiếc pizza.
Nguồn
- I Let an AI Agent Hack All My Gadgets—and I’d Do It Again— WIRED, 10 tháng 9, 2026