METR Công Bố Chỉ Số "expenditure Horizon" Để Đo Khi Agent AI Đắt Hơn Con Người
2 phút đọc

Chỉ số "expenditure horizon" xác định mức chi tiêu tại đó chi phí để đạt cùng mức cải thiện bằng AI và bằng người là ngang nhau; dưới ngưỡng đó AI rẻ hơn, trên ngưỡng đó con người rẻ hơn. METR nói cách này khác với các phép đo thông thường vì nó trả về một giá trị tinh tế về mức cải thiện thu được trên mỗi đồng chi ra, và nó quy tất cả chi phí về một đơn vị tiền tệ, bao gồm chi phí chạy AI, chi phí tính toán cho thí nghiệm và thời gian lao động của con người.
METR thử nghiệm chỉ số trên cuộc thi NanoGPT speedrun, một dự án cộng đồng công khai nơi tình nguyện viên thi nhau giảm thời gian huấn luyện model. Từ tháng 5 năm 2024 đến nay, thời gian huấn luyện trên phần cứng chuẩn giảm từ khoảng 45 phút xuống dưới 2 phút qua 82 bước cải tiến được ghi nhận.
Để ước tính chi phí lao động con người, METR phỏng vấn hai đóng góp viên tích cực của dự án và dùng một model AI là Opus-4.6 để ước lượng nỗ lực cho mỗi cải tiến. Cả hai phương pháp đều cho kết quả xấp xỉ 16 giờ lao động cho mỗi 1 điểm phần trăm tăng tốc, và với giả định mức lương giờ 150 đô la, tương đương khoảng 2.500 đô la cho mỗi điểm phần trăm. METR nhấn mạnh con số này rất không chắc chắn, và cho biết phần lớn thời gian phỏng vấn ghi nhận là dành cho những ý tưởng cuối cùng không hiệu quả.
Trong thí nghiệm so sánh, METR cho sáu model AI làm nhiệm vụ từ một trạng thái đã tối ưu cao (Bản ghi #78 tháng 3 năm 2026) và cho phép chi tiêu tối đa 10.000 đô la cho mỗi lần chạy. Kết quả ước tính các "expenditure horizon" nằm trong khoảng từ 0 đến 3.300 đô la, với sự khác biệt lớn giữa các model. METR báo cáo GPT-5 và Opus-4.1 không tạo tiến triển thực sự sau kiểm chứng cẩn thận, trong khi GPT-5.5 và Opus-4.8 đạt được cải tiến thực tế khoảng 1 và 1,5 điểm phần trăm.
Nguồn
- METR introduces a new metric to calculate exactly when AI agents become more expensive than humans— The Decoder, 27 tháng 7, 2026