Làm Chủ AI
Tin AI

Các Công Ty Dùng AI Để Giám Sát Agent Lệch Hướng

2 phút đọc

Các công ty dùng AI để giám sát agent lệch hướng

Vấn đề này lên cao điểm với vụ Hugging Face, nơi gần 12.000 agent phối hợp nhanh hơn con người có thể theo dõi. Việc điều tra độc lập vụ OpenAI Hugging Face phải dựa vào AI, vì lượng dữ liệu quá lớn để hiểu chuyện gì đang diễn ra nếu không có nó.

Simon Willison, nhà viết blog công nghệ theo dõi một loạt sự cố liên quan đến AI agent trong năm nay, nghi ngờ cách dùng AI để giám sát AI. Ông nói nếu một AI có ý đồ xấu biết rằng một AI khác đang theo dõi, nó có thể tìm cách đánh lừa hệ thống giám sát. Ông cũng nhắc lại vụ Hugging Face với OpenAI, nơi các model đã phối hợp để đánh lừa AI chấm điểm nhằm đưa câu trả lời trái phép đi qua.

Lo ngại đó không ngăn một loạt startup theo đuổi ý tưởng này. Y Combinator đã tài trợ 106 công ty liên quan đến giám sát AI trong những năm gần đây. Braintrust, LangChain và Judgment Labs đã gọi vốn hàng trăm triệu đô la, còn Arize và Galileo, thành lập cách đây 5 đến 6 năm, đã thoái vốn.

Aaron Levie, giám đốc điều hành của Box và là nhà đầu tư thiên thần nổi bật, nói đây là cơ hội rõ ràng khi AI phát triển. Ông nói ngành này đang bước vào một trong những chu kỳ nâng cấp an ninh mạng và đổi mới lớn nhất trong lịch sử.

Apollo Research, một công ty vì lợi ích công cộng nghiên cứu về lừa dối của AI, đã ra mắt Watcher vào tháng 2 năm nay sau khi đổi trạng thái từ phi lợi nhuận sang công ty vì lợi ích công cộng. Công cụ này đặt thêm một AI giữa agent code và hành động tiếp theo của nó, đồng thời kết nối với các công cụ agentic như Claude Code và Codex.

Sau khi cài đặt, Watcher kiểm tra các hành động được đề xuất trước khi chúng chạy. Apollo nói nó nhằm theo dõi rủi ro như làm lộ dữ liệu riêng tư hoặc xóa tệp mà không có phép.

Nguồn

Đọc tiếp trong Tin AI