Trẻ Em Học Ngôn Ngữ Hiệu Quả Hơn Model Lớn, Nguyên Nhân Vẫn Là Bí Ẩn
2 phút đọc

Bài viết nêu rằng con người đã giao tiếp bằng ngôn ngữ ít nhất 100.000 năm, và trong thời gian đó chỉ có trẻ em học được ngôn ngữ tới mức nhuần nhuyễn một cách tự nhiên. Giờ đây các LLM như Claude, DeepSeek và GPT có thể trò chuyện trôi chảy nhưng để đạt được điều đó chúng tiêu thụ khối lượng dữ liệu phi thường.
Tác giả mô tả một khoản cách lớn về hiệu quả dữ liệu giữa trẻ em và máy: LLM có thể xử lý hàng trăm nghìn lần số từ mà một người trải nghiệm khi học ngôn ngữ mẹ đẻ. Khoảng cách này được gọi là data efficiency gap.
Bài dẫn các con số so sánh: Llama 3.1 đã dùng 15 nghìn tỉ token trong giai đoạn huấn luyện, trong khi một trẻ trước tuổi thiếu niên ở môi trường giàu ngôn ngữ có thể nghe khoảng 100 triệu từ và đạt tới 300 triệu từ khi có thêm kỹ năng đọc đến tuổi 20. Một nhà nghiên cứu nói Frontier model có thể huấn luyện trên lượng dữ liệu gấp 10 lần con số đó.
Tác giả nêu lo ngại về nguồn dữ liệu: kho dữ liệu dễ tiếp cận trên internet có hạn, và có thể cạn kiệt sớm, có thể là vào thập niên 2030. Bài cho rằng trẻ em cho thấy việc học hiệu quả với lượng dữ liệu nhỏ hơn là khả thi, và việc giải mã cách trẻ học có thể mang ý nghĩa cho cả nghiên cứu AI và khoa học nhận thức.
Nguồn
- Kids outlearn AI—and we still don’t know why— MIT Technology Review, 24 tháng 8, 2026