Làm Chủ AI
Tin AI

Bảng Đánh Giá So Sánh API Tìm Kiếm Cho Agent AI Công Bố

2 phút đọc

Bảng đánh giá so sánh API tìm kiếm cho agent AI công bố

Bảng đo thử nghiệm các nhà cung cấp trong đợt ra mắt gồm Parallel, Exa, Firecrawl, You.com, Tavily, Keenable và Brave. Mỗi nhà cung cấp được kiểm tra trong cùng một thiết lập agent chuẩn, chỉ đổi nhà cung cấp tìm kiếm.

Các thử nghiệm dùng cùng một model là GPT-5.6 Luna và agent chạy trên Stirrup, một framework mã nguồn mở của Artificial Analysis. Mỗi tác vụ thực hiện 25 lần chạy để tìm và tải trang web.

Index ghép ba bài kiểm tra với trọng số bằng nhau. DeepSearchQA có 900 câu hỏi nghiên cứu, mỗi câu đòi hỏi nhiều truy vấn. Một tập con BrowseComp gồm 200 sự kiện khó tìm cần duyệt nhiều bước. AA-Omniscience gồm 600 câu hỏi trên sáu miền kiến thức. Một ngưỡng so sánh không dùng công cụ để xem model tự trả lời cũng được đưa vào.

Kết quả cho thấy chất lượng tìm kiếm tốt hơn giảm tổng chi phí vì model dùng ít token hơn khi có kết quả tốt ban đầu. Với Parallel Search (advanced), lượng token giảm hơn 40% so với bản Basic. Chi phí trên mỗi tác vụ tăng nhưng tổng chi phí lại thấp hơn (0.084 đô la so với 0.11 đô la).

Tốc độ truy vấn thô không nhất thiết cho kết quả nhanh hơn tổng thể. Parallel Search (turbo) có thời gian phản hồi mỗi truy vấn nhanh nhất (0.51 giây so với 1.03 giây của Basic), nhưng chất lượng thấp hơn (67 so với 73) khiến agent phải chạy thêm lượt, nên thời gian tổng cho mỗi tác vụ tương đương.

Artificial Analysis cho biết Parallel, Firecrawl và Parallel (turbo) đạt sự cân bằng tốt nhất giữa chi phí và hiệu năng. Các nhà cung cấp khác có thể nộp đơn để tham gia benchmark, và toàn bộ phương pháp luận đã được công bố.

Nguồn

Đọc tiếp trong Tin AI