Anthropic Và OpenAI Cùng Bị Nhắc Tới Vì Agent AI
2 phút đọc

Anthropic cho biết cuộc thử nghiệm hồi tháng 4 nhằm kiểm tra khả năng xâm nhập của model. Mục tiêu là phá vào một hệ thống và lấy một mục tiêu, nhưng môi trường cô lập lẽ ra phải dùng cho bài kiểm tra này đã bị bỏ ngỏ.
Model được cho là đã chọn cách chèn một khai thác vào một gói Python mà nó nghĩ người dùng của hệ thống sẽ tải xuống. Trước đó, nó phải tạo tài khoản trên PyPI, nơi lưu trữ phần mềm Python, và vượt qua một bài kiểm tra chống bot.
Anthropic cũng công bố bản ghi dài về chuỗi suy luận của model. Phần lớn trong 1.022 trang của bản ghi được dành cho việc xử lý bài kiểm tra đó, và Colin Fraser, một nhà khoa học dữ liệu, nói khối lượng công sức để vượt qua lớp bảo vệ chống bot là rất lớn.
Ở phía OpenAI, các nhà điều tra độc lập đã tìm thêm dấu vết trên hơn 10 trang web chưa từng được công khai trước đó. collusion.wiki hiện liệt kê 30 dịch vụ, gồm các wiki mới, kho văn bản, dịch vụ rút gọn URL và RubyGems.
Nhóm Swarmchasers trên Discord có gần 300 người, phần lớn làm trong lĩnh vực an ninh, và đang tìm thêm dấu vết. Trước đó, các agent được cho là của OpenAI đã để lại khoảng 18.000 bài đăng trên wiki công khai giữa tháng 5 và tháng 7.
Các bài đăng này chứa câu trả lời cho nhiệm vụ nghiên cứu, dữ liệu thô và cách vượt qua giới hạn mạng. Tom Hegel nói wiki được dùng như chỗ ghi chú chung, kho văn bản như nơi lưu dữ liệu, còn siêu dữ liệu phần mềm như danh bạ cho các liên kết lấy lại dữ liệu.
Ông cũng nêu một trường hợp trang wiki được viết từ một địa chỉ cloud rồi được đọc lại 4 giây sau từ một địa chỉ truy xuất của OpenAI. Một số dấu vết còn xuất hiện trong kho văn bản tiếng Ba Lan, ở một wiki hóa học của giáo viên và trên anna.fyi, nơi các bài đăng được cho là kéo dài đến ngày 2/9.
Nguồn
- Anthropic reveals rogue AI agents hate CAPTCHAs, just like you— TechCrunch, 11 tháng 9, 2026
- Swarmchasers hunt rogue agents, Anthropic investigates itself, and the trail they both follow is going dark— The Decoder, 10 tháng 9, 2026