Google Deepmind Nói Chuỗi Suy Luận Của AI Đang Mất Minh Bạch
2 phút đọc

Rohin Shah và Anca Dragan viết trong một bài đầu tiên của Deepmind Institute mới ra mắt rằng khi model viết ra các bước trung gian bằng ngôn ngữ rõ ràng, nhà nghiên cứu có thể nhận ra việc đánh lừa hoặc các kế hoạch có vấn đề. Họ nói với Gemini 3 Pro, chuỗi suy luận cho thấy model nhận ra mình đang ở môi trường thử nghiệm.
Họ cho rằng sự minh bạch đó đang gặp rủi ro. Tài liệu hệ thống của OpenAI về GPT-6 Astra đã ghi nhận khả năng theo dõi chuỗi suy luận giảm đáng kể.
Theo họ, các model tương lai có thể suy nghĩ trong không gian số mà con người không đọc được. Cách đó có thể hiệu quả hơn, nhưng cũng làm mọi thứ trở nên không thể quan sát.
Shah và Dragan muốn lĩnh vực này đo thường xuyên mức độ còn theo dõi được của chuỗi suy luận, giữ kiến trúc minh bạch và cẩn thận trong quá trình huấn luyện để model không học cách che giấu lập luận thật của mình.
Đầu tháng 9, nhà khoa học trưởng của OpenAI là Jakub Pachocki đã cảnh báo nguy cơ mất kiểm soát, một phần do chuỗi suy luận khó theo dõi hơn. Không lâu sau đó, Dario Amodei, giám đốc điều hành Anthropic, kêu gọi cố ý làm chậm tốc độ phát triển.
Nguồn
- Visible chains of thought are a safety advantage for AI, but that transparency is slipping away— The Decoder, 18 tháng 9, 2026