Nghiên Cứu Cho Thấy Bước Suy Luận Tách Được Trong Model
2 phút đọc

Nhóm ở KAIST và Naver AI Lab thử xem các bước suy luận mà model thể hiện trong đầu ra chữ có thể được tách ra trong biểu diễn bên trong hay không. Họ nói là có, và tín hiệu rõ nhất nằm ở các lớp giữa.
Nhóm xác định 8 thao tác suy luận lặp lại, gồm trích xuất, phân rã, nhớ lại công thức, suy diễn và tính toán. Họ cho 3 model là Qwen2.5-7B, Qwen3-8B và Gemma4-31B giải các bài toán toán học, rồi chia các đường đi lời giải thành từng đoạn.
Sau đó GPT-5 gắn nhãn từng đoạn bằng một trong các thao tác đó. Kết quả cho thấy các thao tác khác nhau có thể được phân biệt đáng tin cậy trong biểu diễn bên trong của cả 3 model.
Nhóm cũng kiểm tra xem chỉ khác nhau ở cách dùng từ có giải thích được hay không. Bộ phân loại chỉ nhìn token cho kết quả kém hơn bộ phân tích biểu diễn bên trong, và vị trí trong đường đi lời giải cũng không giải thích được điều này.
Các từ chức năng quen thuộc xuất hiện ở nhiều bước suy luận khác nhau. Ở lớp đầu, biểu diễn còn lẫn với nhau, nhưng về giữa và cuối thì tách theo thao tác xung quanh; cùng một từ có thể có biểu diễn bên trong khác nhau tùy nó thuộc bước nào.
Nhóm chặn việc chú ý tới 30 token trước đó bằng một can thiệp có chủ đích. Khi đó tín hiệu của thao tác giảm xuống, cho thấy các bước suy luận không tự hình thành riêng lẻ mà dựa trên ngữ cảnh phía trước.
Ngay cả trên các bài làm sai, kiểu bước mà model đang thực hiện vẫn nhận ra được, dù đó là tính toán, nhớ lại công thức hay suy diễn. Kết quả này lặp lại với Llama-3-8B, và với Qwen3-8B, bộ phân loại chuyển được sang GPQA-Diamond và MATH-500.
Tuy vậy, thử nghiệm chỉ xoay quanh bài toán toán học và một số model. Việc dùng các kết quả này để bắt lỗi hay điều khiển model giữa lúc sinh câu trả lời vẫn là câu hỏi mở.
Nguồn
- AI models' written reasoning steps correspond to distinct internal patterns, a new study finds— The Decoder, 12 tháng 9, 2026