Richard Sutton: Dữ Liệu Tổng Hợp Là "một Sai Lầm Lớn"
2 phút đọc

Richard Sutton, người từng đoạt giải Turing và là một trong những người sáng lập lĩnh vực reinforcement learning, trình bày quan điểm này trong một cuộc trao đổi khi giới thiệu công ty mới Oak Lab, đồng sáng lập với Khurram Javeed.
Sutton nhắc lại ý trong bài luận 2019 "The Bitter Lesson": các phương pháp thắng thế về lâu dài là những phương pháp mở rộng theo năng lực tính toán, như tìm kiếm và học, chứ không phải những phương pháp dựa vào kiến thức con người có sẵn. Ông cho rằng large language model là ví dụ vừa tốt vừa xấu của bài học này.
Sutton lập luận internet là hữu hạn trong khi thế giới thực "khổng lồ hơn rất nhiều so với mọi thứ chúng ta lưu trên internet"; khi gặp giới hạn đó, việc dựa vào kiến thức con người làm các hệ thống bị kìm lại. Ông trích dẫn giả thuyết "Big World" do Khurram Javeed đưa ra, theo đó thế giới có độ phức tạp vô hạn so với bất kỳ mô phỏng nhỏ nào.
Ông phản đối dữ liệu tổng hợp với hai lý do chính nêu trong cuộc trao đổi: mô phỏng luôn là một thế giới rất nhỏ so với thực tế và không thể tạo chính xác các hành vi của các tác nhân khác, và việc chọn dữ liệu tổng hợp tốt hay xấu vẫn lệ thuộc chuyên gia con người, tạo ra một nút thắt cổ chai. Làm ví dụ, để huấn luyện một drone bắt chước dơi bằng cách mô phỏng tiếng vang, vẫn cần chuyên gia miền để thu hẹp khoảng cách giữa mô phỏng và thực tế.
Thay vì dựa vào mô phỏng cố định, Sutton đề xuất loại bỏ con người khỏi vòng lặp và để các agent tự học từ trải nghiệm của chính chúng, nghĩa là các simulator do chính agent tạo ra và liên tục sửa chúng.
Nguồn
- KI-Pioneer Sutton calls synthetic data a "big mistake" in the face of an infinitely complex world— The Decoder, 20 tháng 8, 2026