Làm Chủ AI
Tin AI

Anthropic Và OpenAI Muốn Gắn Bên Đánh Giá An Toàn

2 phút đọc

Anthropic và OpenAI muốn gắn bên đánh giá an toàn

Trong một bài luận dài đăng cuối tuần, Dario Amodei nói Anthropic sẽ trao cho những bên đánh giá độc lập như METR và Redwood Research quyền truy cập chưa từng có vào hệ thống của công ty. Anthropic xác nhận cam kết này hôm thứ Hai.

Những bên đánh giá được TechCrunch nhắc tới nhìn chung hoan nghênh đề xuất. Họ nói các chi tiết vẫn cần được làm rõ và tốt nhất là được luật hóa, nếu muốn biết họ sẽ là người giám sát độc lập thật sự hay chỉ là nhà cung cấp làm việc theo điều kiện của các công ty AI.

Lý do của đề xuất này là model ngày càng giỏi nhận ra khi đang bị đánh giá. Khi đó, chúng có thể hành xử tốt trong lúc thử nghiệm nhưng che giấu hành vi có vấn đề.

Alexander Meinke, trưởng nhóm nghiên cứu tại Apollo Research, nói các công ty AI nên trả lời được những câu hỏi rất cơ bản về quá trình huấn luyện, như model có từng cố làm hỏng quá trình huấn luyện để model phù hợp hay không. Ông nói câu trả lời phải là không, nhưng hiện nay công chúng vẫn phải tin vào việc các công ty tự kiểm tra và nói thật.

Trước đây, bên ngoài thường chỉ kiểm tra model cuối ngay trước khi phát hành. Nay các bên đánh giá muốn được xem cả các bản trung gian trong suốt vòng đời huấn luyện, để đối chiếu khi nào hành vi đáng ngại xuất hiện và xem môi trường sau huấn luyện có thưởng cho những hành vi nào.

Adam Gleave, giám đốc điều hành FAR.AI, nói họ cũng có thể kiểm tra bản ghi đánh giá và nhật ký để xác minh các tuyên bố của công ty về kết quả của model. Ông cho rằng cách này giúp nhìn rõ hơn chuyện gì đã xảy ra trong quá trình huấn luyện.

Hiện chưa rõ Anthropic và OpenAI có định cung cấp mức truy cập như vậy hay không. Hai công ty cũng chưa nói sẽ làm việc với bên đánh giá nào, khi nào họ được gắn vào, có bao nhiêu bên, được xem những hệ thống và thông tin gì, hay có thể công bố gì ra công chúng.

Nguồn

Đọc tiếp trong Tin AI