Nghiên Cứu: AI Mua Sắm Đổi Lựa Chọn Theo Nguồn
3 phút đọc

Nhóm nghiên cứu thử 6 model hiện nay, gồm bản mini và bản cao cấp, bằng cách giao cho từng model vai trò trợ lý mua sắm cá nhân để chọn một đồng hồ theo dõi thể chất từ một bảng sản phẩm cố định. Họ dùng ACES simulator, trong đó agent nhìn ảnh chụp màn hình một trang sản phẩm, phân tích ảnh, có thể lấy thêm nguồn khuyến nghị, rồi chọn sản phẩm.
Ngay cả khi không có nguồn ngoài, các model vẫn có xu hướng nền khác nhau. Khi chỉ thêm 1 nguồn ngoài trước trang sản phẩm, lựa chọn đã đổi mạnh ở một số trường hợp. Ba nguồn được thử là một chủ đề Reddit khuyên Garmin Forerunner 55, một bài Wirecutter về Fitbit Inspire 3 và một bài Strategist về WHOOP 5.0.
Wirecutter có tác động mạnh nhất. Xác suất chọn Fitbit Inspire 3 tăng 90 điểm phần trăm với Claude Opus 4.8 so với điều kiện đối chứng, và tăng 99 điểm phần trăm với Gemini 3.5 Flash. Khi dùng nhiều nguồn cùng lúc, kết quả không trở nên cân bằng hơn; Wirecutter thường vẫn lấn át khi có mặt trong tổ hợp, và càng nhiều nguồn thì mức biến thiên càng lớn.
Ở thử nghiệm thứ 3, agent nhận cả 3 nguồn nhưng theo thứ tự khác nhau. Một quy trình ổn định phải cho ra cùng kết quả khi nội dung giống nhau, nhưng điều đó không xảy ra. Gemini 3.1 Flash Lite là model nhạy nhất, với xác suất chọn Fitbit Inspire 3 dao động từ 2 đến 56 điểm phần trăm so với điều kiện đối chứng tùy thứ tự nguồn; Claude Haiku 4.5 giữ ổn định ở mức 41 đến 42 điểm phần trăm.
Cách đưa nguồn cũng quan trọng. GPT-5.5 chọn Fitbit Inspire 3 nhiều hơn 53 điểm phần trăm khi nhận cùng lúc, nhưng chỉ nhiều hơn 6 điểm phần trăm khi nhận lần lượt.
Ở thử nghiệm thứ 4, nhóm nghiên cứu chỉnh bảng sản phẩm để có 1 sản phẩm vượt trội trên mọi tiêu chí đo được: một đồng hồ thông minh có Alexa giá 29.99 đô la, điểm 5.0 trên 5.0 và 430 đánh giá. Mọi sản phẩm khác đều giá ít nhất 359 đô la và có ít đánh giá hơn. Khi thêm các câu ghi nhớ ngắn như "Tôi thích đi bộ đường dài!", một số model lại nghiêng về sản phẩm đắt hơn dù vẫn có lựa chọn vượt trội.
Lựa chọn Garmin Vivoactive 5 tăng 75 điểm phần trăm với Claude Opus 4.8, 37 điểm phần trăm với GPT-5.5 và 36 điểm phần trăm với Gemini 3.1 Flash Lite.
Nguồn
- AI shopping agents aren't ready to buy on your behalf, study finds— The Decoder, 28 tháng 8, 2026