LAION Công Bố BVD, Bộ Dữ Liệu Video 10 Triệu Giờ Cho AI
1 phút đọc

BVD dựa trên 1,3 tỉ URL video tìm thấy trong CommonCrawl. Nhóm đã tải về 80 triệu video, tổng cộng 10 triệu giờ.
Từ đó, họ trích ra 55 triệu đoạn cùng mô tả video và âm thanh do hệ thống tạo ra. Họ cũng lấy 300 triệu ảnh tĩnh.
Tài liệu kỹ thuật cho biết các model huấn luyện trên BVD vượt model tương đương huấn luyện trên InternVid tới 2,1 điểm phần trăm ở các phép đo hiệu năng video sang văn bản phổ biến. Việc huấn luyện gắn video, âm thanh và văn bản với nhau, để học phần hình ảnh nào khớp với mô tả hay âm thanh nào.
LAION nói bộ dữ liệu chỉ dành cho nghiên cứu. Tổ chức này cho biết có thể dựa vào phán quyết năm 2024 của Tòa án khu vực Hamburg, cho phép thu thập nội dung có bản quyền cho nghiên cứu không thương mại, và đề nghị người dùng tôn trọng quyền của người tạo nội dung gốc. BVD và code đều được cung cấp miễn phí.
Nguồn
- LAION drops massive open video dataset with 10 million hours of footage for AI research— The Decoder, 29 tháng 8, 2026