Bộ Công Cụ Mới Phát Hiện Giới Hạn Thị Giác Của Model AI Đa Phương Thức
2 phút đọc

PerceptionBench do đội của trợ lý AI Trung Quốc Kimi xây dựng, chia thị giác thành 10 kỹ năng nguyên tử gồm Quan hệ hình ảnh, Đếm, Thuộc tính, Độ sâu & 3D, Định vị, So sánh, Nhận dạng tinh vi, Tích hợp bối cảnh, OCR và Bịa đặt.
Bộ phép đo xuất phát từ hơn 17.000 câu hỏi đã được xác thực và công bố 3.000 tác vụ; 60% tác vụ được lấy từ lỗi do model gây ra, 40% được chuyển thể bằng cách tăng cường hình ảnh. Mỗi câu hỏi chỉ yêu cầu nhìn hình, không cần suy luận hay kiến thức bên ngoài.
Kết quả thử nghiệm trên 16 model tiên phong cho thấy điểm cao nhất là 59,7% do GPT-5.6 Sol đạt. Các vị trí tiếp theo lần lượt là Kimi K3 58,5%, Claude Fable 5 57,2% và Gemini 3.1 Pro 56,2%. GPT-5.5 ghi 55,8%. Một số model mã nguồn mở như Qwen3.5-397B-A17B đạt 47,5% và GLM-4.6V 32,5%.
Các kết quả theo loại kỹ năng cho thấy sự khác biệt lớn giữa các model có cùng điểm tổng thể. Nhóm tác giả ghi nhận 'bia đặt' (hallucination) là kỹ năng yếu nhất trung bình, với GPT-5.6 Sol chỉ đạt 26,9% ở mục này, trong khi Gemini 3.5 Flash lại đạt 50,6%.
Tác giả cho rằng nhiều lỗi từng bị gán cho sai sót suy luận thực ra xuất phát từ giai đoạn đọc ảnh ban đầu. Khi một tác vụ nhiều bước bị hỏng, bước đầu là đọc đúng hình ảnh thường đã thất bại.
Nguồn
- AI’s recursive self-improvement might not come so quickly after all— MIT Technology Review, 18 tháng 8, 2026
- New benchmark confirms AI models still perform poorly at visual perception— The Decoder, 15 tháng 8, 2026
- Study contradicts Anthropic and OpenAI claims that autonomous AI research is within reach— The Decoder, 14 tháng 8, 2026
- Top AI lab researchers warned about automated AI research, and several of their predicted milestones have already fallen— The Decoder, 13 tháng 8, 2026