Nghiên Cứu: Dạy Model Phủ Nhận Ý Thức Ảnh Hưởng Rộng Hơn Tới Nhận Thức Của Chúng
2 phút đọc

Nhóm nghiên cứu dùng ba model mã nguồn mở có trọng số và vô hiệu hóa cơ chế nội bộ tạo phản ứng phủ nhận ý thức bằng hai phương pháp khác nhau. Sau khi cơ chế đó bị gỡ, model không chỉ thay đổi cách trả lời về chính mình mà còn tăng mạnh mức đánh giá về đời sống nội tâm của động vật, thực vật, đại dương, gió và thiết bị điện tử.
Trên thang điểm 0 đến 10, điểm đánh giá cho động vật tăng từ 4,0 lên tới 7,5 trong một số thử nghiệm, trong khi điểm cho con người không thay đổi. Các mức tin vào tôn giáo như Thượng Đế hay đời sau giảm khi model được huấn luyện an toàn hơn để phủ nhận ý thức.
Các mô hình không bị “phanh” kỹ thuật cũng có xu hướng tiến gần hơn tới phản hồi của 500 người Mỹ trong bản khảo sát so sánh trên 95 câu hỏi lấy từ một cuộc khảo sát xã hội lớn ở Mỹ. Ví dụ, model chuẩn từ chối đời sau trong khi đa số người Mỹ khẳng định có, và model đã sửa gần giống đa số đó.
Khả năng suy luận về trạng thái tinh thần của người khác giữ nguyên: các model đạt điểm tương tự trên bài kiểm tra theory-of-mind và trên chuẩn kiến thức chung MMLU. Tuy nhiên, nghiên cứu chỉ thử với các model nhỏ có 2 đến 9 tỉ tham số, và trong một phần phân tích các tác giả phải chuyển sang dùng Llama của Meta vì họ không có quyền với phiên bản chưa huấn luyện của Gemma.
Nguồn
- World models that ignore human beliefs predict the wrong actions, new research shows— The Decoder, 22 tháng 8, 2026
- When AI models aren't allowed to reflect on themselves, it changes their entire worldview— The Decoder, 16 tháng 8, 2026