Netflix Thử Model Ngôn Ngữ Cho Đề Xuất, Gọi Là GenRec
2 phút đọc

GenRec gồm hai giai đoạn huấn luyện. Giai đoạn một là tinh chỉnh một model ngôn ngữ mã nguồn mở chưa được đặt tên trên dữ liệu Netflix để model hiểu danh mục và hành vi người xem. Giai đoạn hai là huấn luyện chuyên biệt để biến model cơ sở thành bộ xếp hạng đề xuất; giai đoạn này được cập nhật thường xuyên hơn để phản ánh tiêu đề mới và thay đổi sở thích.
Thay vì mã hóa dữ liệu người dùng thành vectơ dày đặc, Netflix chuyển các tương tác thành văn bản thuần: lượt xem, thời lượng, thích/không thích, thêm vào danh sách, và bỏ giữa chừng trở thành dạng đối thoại giữa người dùng và hệ thống. Netflix lọc mạnh mẽ để tránh vượt quá cửa sổ ngữ cảnh: sự kiện tín hiệu cao như phiên xem dài giữ nguyên chi tiết, thao tác nhanh bị loại, và các phiên binge được cô đọng.
Để ngăn model đề xuất tiêu đề không tồn tại, Netflix bổ sung một thành phần riêng chỉ chấm điểm những mục thực có trong danh mục. GenRec chạy trên vLLM ở chế độ model đọc một lần và chấm điểm tất cả ứng viên một lần mà không sinh văn bản, giúp kiểm soát chi phí.
So sánh với hệ thống sản xuất hiện tại, GenRec cho chất lượng xếp hạng tốt hơn khoảng 1,6% ở phép đo ngoại tuyến và cần khoảng 40 lần ít hơn ví dụ có nhãn trong giai đoạn hai để đạt kết quả đó. Trong thử nghiệm A/B trực tuyến bốn tuần trên khoảng 10% lưu lượng, một chỉ số ngắn hạn trên màn hình chính tăng 0,115% và một chỉ số cốt lõi dài hạn tăng 0,006%; Netflix cho rằng hai mức tăng này không phải do ngẫu nhiên.
Netflix cũng báo rằng việc tinh chỉnh chuyên cho đề xuất ở Giai đoạn 2 đem lại thêm 35–50% so với hiệu năng model cơ sở, và khi model cơ sở đã hai tuần tuổi thì khoảng cách này rộng lên khoảng 80%.
Nguồn
- Netflix tests language model as alternative to hand-built recommendation logic— The Decoder, 22 tháng 8, 2026