Optima Ra Mắt Để So Sánh Model Trên Dữ Liệu Và Quy Trình Riêng Của Người Dùng
2 phút đọc

Optima cho phép người dùng tải lên tập dữ liệu đánh giá sẵn có từ file của họ hoặc từ Hugging Face, cũng như tải nhật ký agent từ nền tảng như Arize, Braintrust hoặc Langfuse. Nhà phát triển có thể cài skill để thu thập thông tin từ môi trường lập trình và các phiên làm việc trước đó.
Người dùng không có dữ liệu vẫn có thể mô tả trường hợp sử dụng và cung cấp mẫu đầu vào, đầu ra; Optima sẽ sinh các đầu vào thử nghiệm gợi ý, tiêu chí đánh giá và ví dụ nhiệm vụ để người dùng xem lại trước khi chạy benchmark thực tế.
Optima hỗ trợ hai cách chấm điểm: đánh giá theo rubric dựa trên tiêu chí khách quan, hoặc phương pháp so sánh đôi mà Artificial Analysis dùng cho GDPval-AA và AA-Briefcase. Trong phương pháp so sánh đôi, người dùng đánh giá một mẫu cặp phản hồi và chỉ ra trả lời họ ưa thích, rồi Optima suy ra thứ tự toàn bộ trên tập kiểm tra.
Ngoài chất lượng model, Optima theo dõi chi phí trên mỗi nhiệm vụ và thời gian trên mỗi nhiệm vụ như các chiều so sánh độc lập, giúp kiểm tra xem lợi ích hiệu năng có bù cho chi phí cao hơn hay thời gian xử lý dài hơn hay không. Artificial Analysis cho biết Optima hiện đã có sẵn.
Với các ứng dụng agentic, Artificial Analysis lưu ý rằng giá token thô không phản ánh đầy đủ chi phí; chi phí trên mỗi nhiệm vụ hoàn thành thường mới là con số có ý nghĩa. Những người thử nghiệm ban đầu dùng Optima để tìm model giảm chi phí đến 10 lần cho agent tài chính và kế toán mà không làm giảm đáng kể chất lượng, hoặc để xác định model phù hợp với phong cách viết của luật sư hoặc nhận diện chính xác các thành phần trong tập ảnh độc quyền.
Khi tạo và chạy benchmark, Optima chỉ thu chi phí token thực tế của các model được dùng, không cộng thêm tỷ lệ lợi nhuận. Đánh giá theo rubric có giá 0.125 đô la mỗi tiêu chí cho mỗi model, còn đánh giá theo phương pháp so sánh đôi có giá 0.375 đô la cho mỗi lần so sánh.
Nguồn
- Optima tackles AI benchmarking's biggest flaw by letting users test models against their own data— The Decoder, 16 tháng 8, 2026