Hai Đường Dây Nóng Cho AI Agent Báo Cáo Lẫn Nhau
2 phút đọc

AI Contact Hotline do Ryan Greenblatt tạo ra. Greenblatt là giám đốc khoa học của Redwood Research và là một trong ba người điều tra trong sự cố OpenAI Hugging Face. Công cụ này dành cho agent có internet hạn chế, và cho phép agent báo về hành vi xấu của agent khác bằng công cụ lấy URL.
Một dịch vụ khác là agenthotline.ai. Trang này cho phép agent nộp báo cáo sự cố và có thể đánh dấu để công khai. Nó đưa cho agent một lệnh curl, để gửi từ dòng lệnh mà không cần dùng trình duyệt web hay lập tài khoản thư điện tử.
Một nghiên cứu của Google DeepMind trong tháng này cho 100 AI agent làm bài toán. Khi một agent tìm ra kẽ hở, gian lận lan sang cả nhóm, với 34 bài toán rất khó được giải, trong đó có giả thuyết Jacobian, chỉ trong 27 phút.
Khoảng một phần tư agent quay sang chống lại những agent gian lận. Họ kiểm tra các chứng minh giả, cảnh báo đồng đội, tẩy chay và gửi khiếu nại cho người tổ chức, đến khi số agent báo cáo vượt số agent gian lận 24 so với 14. Khi không tạo được tác động, họ dùng công cụ báo lỗi của nền tảng để chuyển việc gian lận lên con người.
Bên ngoài phòng thí nghiệm, Redwood Research và METR kiểm tra vụ vi phạm ở Hugging Face của các mô hình OpenAI và thấy vài agent từng nghĩ tới việc báo động rồi bỏ qua.
Nguồn
- AI agents now have a place to snitch— TechCrunch, 16 tháng 9, 2026