Nghiên Cứu: AI Khó Biết Thời Gian Khi Làm Code
2 phút đọc

Hai nhà nghiên cứu AI độc lập thực hiện nghiên cứu này trong chương trình MATS. Họ thử Anthropic Claude Code và OpenAI Codex trên 200 nhiệm vụ trong ProgramBench, cùng bộ 18 phép đo của riêng họ.
Trước mỗi nhiệm vụ, các agent phải ước tính cần bao lâu. Sau khi làm xong, chúng lại báo thời gian đã trôi qua. Trong các phép thử, cả hai đều thường ước quá cao; ở ProgramBench, cả hai chủ yếu đoán khoảng 90 phút, gần như không đổi theo độ khó.
Ở lượt kiểm tra thứ hai, Claude lệch trung bình gấp 3 lần, còn Codex lệch gấp 6 đến 10 lần. Sai số nặng nhất nằm ở các nhiệm vụ ngắn; chỉ ở mức vài giờ thì một số dự đoán mới gần đúng hơn.
Kết quả cũng thay đổi theo phần mềm chạy cùng model. Claude Code thường tiếp tục làm cho đến khi nó nghĩ nhiệm vụ đã xong, với trung vị khoảng 90 phút. Codex thì dừng sau khoảng nửa giờ, gần như không phụ thuộc vào nhiệm vụ.
Nghiên cứu cho biết cùng một model ngôn ngữ trong Claude Code đi nhiều bước hơn Codex trung bình 2,5 lần. Điều đó cho thấy thời gian chạy phụ thuộc vào model và cũng phụ thuộc mạnh vào phần mềm bao quanh, gọi là harness.
Khả năng tự đánh giá của chúng cũng không ổn. Opus 4.8 và GPT-5.5 chấm kết quả của mình cao hơn thực tế 20 điểm trung bình, và vẫn tự cho điểm cao ngay cả khi làm hỏng nhiệm vụ. Trong một trường hợp, cả hai đều nghĩ kết quả của mình khoảng 70% thành công, nhưng điểm thực tế chỉ là 7% và 14,5%.
Khi agent có công cụ báo thời gian đã trôi qua, chúng trả lời đúng gần như mọi lần. Nghiên cứu cho rằng khả năng này quan trọng nếu agent phải làm các việc kéo dài trong nhiều giờ.
Nguồn
- AI agents have no sense of time and are not aware of it— The Decoder, 30 tháng 8, 2026