Các Nhà Nghiên Cứu Phát Hiện Cách Trích Xuất 'suy Nghĩ' Ẩn Của Model AI
2 phút đọc

Nhóm gồm nhà nghiên cứu từ University of Tübingen, Max Planck Institute, MATS Research và công ty an ninh Snyk mô tả phát hiện trong một bài báo. Alexander Panfilov từ University of Tübingen nói phương pháp này tồn tại ở mọi nhà cung cấp model tiên tiến họ thử nghiệm và có thể dẫn đến rò rỉ thông tin cá nhân.
Các tác giả cho biết họ đã dùng phương pháp để so sánh dấu vết suy luận viết ra khi giải bài toán của Claude Opus 4.8 và GPT 5.6 Sol với đầu ra của model Kimi K3 do Moonshot AI phát hành ở dạng trọng số mở. Kimi K3 cho kết quả tương đồng rõ rệt với các dấu vết suy luận của Claude Opus 4.8 cho một số câu lệnh, dù nhóm nghiên cứu nhấn mạnh rằng công trình không thể khẳng định một cách nhân quả rằng có 'distillation'.
Nhóm cũng kiểm tra hai model mở khác, DeepSeek của Trung Quốc và Inkling của Thinking Machines (Mỹ), và thấy chúng không biểu hiện độ tương đồng suy luận kiểu đó với Claude Opus. Các tác giả lưu ý phương pháp còn có thể được dùng để khôi phục thông tin cá nhân như mật khẩu và khóa API từ suy luận ẩn của model, nhưng lỗ hổng này đã được khắc phục.
Bài báo ghi rằng 'distillation' là kỹ thuật đã được biết và dùng rộng rãi để sao chép năng lực giữa model, đặc biệt với model mở tải xuống, và gần đây trở thành chủ đề tranh cãi liên quan cáo buộc một số công ty Trung Quốc dùng distillation để sao chép model từ Mỹ. Bài viết dẫn ví dụ OpenAI và Anthropic từng nêu vấn đề distillation với một số model do các bên khác phát triển.
Moonshot AI và Z.ai không phản hồi yêu cầu bình luận trước khi bài viết được công bố.
Nguồn
- "But marinade" and leaked passwords are what researchers found in ChatGPT's hidden reasoning— The Decoder, 12 tháng 8, 2026
- A New Trick Reveals AI Models’ Inner Thoughts— WIRED, 11 tháng 8, 2026