OpenAI Công Bố Dữ Liệu Nội Bộ Về Agent Nghiên Cứu
3 phút đọc

OpenAI công bố cùng lúc 2 văn bản: một bài đăng với số liệu nội bộ về nghiên cứu ngày càng tự động, và tiểu luận "An Alien Mind" của giám đốc khoa học Jakub Pachocki. Hai văn bản xuất hiện 3 ngày sau khi công ty ra mắt GPT-6 Astra. Công ty nói mình đang đi nhanh tới tự cải thiện AI và xem đó là điều nguy hiểm.
Công ty cho biết đã đạt mục tiêu đặt ra từ mùa thu năm ngoái về một "automated research intern". Hệ thống này xử lý các việc nghiên cứu có phạm vi rõ ràng dưới sự hướng dẫn của người, kể cả những việc mà một nhà nghiên cứu có kinh nghiệm có thể mất vài ngày. OpenAI không đưa ra kiểm chứng chi tiết cho tuyên bố này.
Bài đăng chỉ nói mục tiêu đó đã đạt được "theo các phép đo của chúng tôi". Công ty đặt mục tiêu đến tháng 3 2028 xây dựng một nhà nghiên cứu AI tự động hoàn chỉnh. Người vẫn là bên đặt ưu tiên nghiên cứu, đánh giá kết quả và quyết định về mở rộng, tạm dừng và triển khai.
Các số liệu sử dụng cho thấy agent code đã đi sâu vào công việc hằng ngày. Theo báo cáo, nhà nghiên cứu trung vị ở OpenAI tiêu hơn 600 đô la mỗi ngày cho chạy suy luận theo giá API, còn mức 90% vượt 7.000 đô la. Đầu ra token của nhà nghiên cứu trung vị đã tăng 124 lần kể từ tháng 12 2025.
Từ tháng 6, thời gian chạy của agent đã vượt giờ làm việc của người. Đến giữa tháng 8, tổ chức nghiên cứu vận hành 3,1 ngày làm việc của agent cho mỗi ngày làm việc của người.
OpenAI nói những số liệu này khá dễ thu thập nhưng khó diễn giải vì quan hệ của chúng với tiến bộ nghiên cứu còn chưa chắc chắn. Số thí nghiệm trên mỗi nhà nghiên cứu đạt mức cao nhất trong tháng 8, kể từ khi theo dõi bắt đầu vào đầu 2025, và đi cùng với năng lực tính toán tăng mạnh. Công ty cho rằng tiến bộ chung có thể chậm hơn các chỉ số riêng lẻ vì những việc khó tự động hóa nhất trở thành nút thắt.
Công ty dùng phân loại của Epoch AI để xem các loại công việc nghiên cứu đang đổi ra sao. Mọi nhóm đều tăng, nhưng tăng mạnh nhất là viết nghiên cứu và code hạ tầng, hỗ trợ kỹ thuật và theo dõi các lượt huấn luyện. Ngược lại, các quyết định lập kế hoạch cấp cao chỉ chiếm phần rất nhỏ trong đầu ra của agent.
OpenAI cũng dùng một bộ phân loại agentic để kiểm tra xem agent có thật sự giải được việc được giao hay không. Hệ thống này chỉ áp dụng cho các việc có kết quả đo được rõ ràng và được chia theo thời gian một người cần. Từ tháng 1 đến tháng 7, tỉ lệ thành công tăng ở một số mức độ khó.
Nguồn
- OpenAI reports AI "research interns" and warns about its own pace at the same time— The Decoder, 7 tháng 9, 2026