Làm Chủ AI
Tin AI

Black Forest Labs Ra Flux 3, Model Đa Phương Thức Sinh Video Có Âm Thanh Gốc 20 Giây

2 phút đọc

Black Forest Labs ra Flux 3, model đa phương thức sinh video có âm thanh gốc 20 giây

Công ty mô tả Flux 3 là bước tiến hướng tới "trí tuệ thị giác thế giới thực", với khả năng nhận biết, dự đoán và hành động trên môi trường vật lý và số. Flux 3 học từ ảnh, video và âm thanh cùng lúc để bù đắp thông tin giữa các loại dữ liệu.

Flux 3 hỗ trợ nhiều chế độ tạo nội dung, bao gồm văn bản thành video, ảnh thành video, video thành video, chuyển cảnh dựa trên khung chính, đối thoại đa ngôn ngữ và liên kết do agent điều khiển để tạo chuỗi nhiều cảnh. Công ty nói model đặc biệt mạnh về biểu cảm khuôn mặt và khớp âm thanh với sự kiện vật lý.

Trong thử nghiệm sơ bộ với clip 10 giây ở 720p, BFL cho biết Flux 3 được chọn hơn Luma Ray 3.2 ở 93% so sánh, hơn Runway Gen-4.5 ở 77%, và hơn Grok Imagine Video ở 69%. Tỷ lệ ưa thích thấp hơn khi so với các đối thủ mạnh hơn: Kling v3 Pro 60%, Happy Horse v1 59%, Happy Horse 1.1 57%, Seedance 2.0 52% và Gemini Omni Flash 52%. BFL nói các kết quả này là sơ bộ và chưa có thử nghiệm độc lập.

BFL cho biết Flux 3 còn giúp cải thiện sinh ảnh, nhất là với prompt phức tạp và render chữ chính xác đa ngôn ngữ, và dự định phát hành Flux 3 Image ở giai đoạn truy cập sớm trong vài tuần tới. Công ty cũng cho biết họ đang triển khai các tính năng theo giai đoạn để thu nhận phản hồi và kiểm tra an toàn.

Flux 3 dựa trên phương pháp Self-Flow của BFL, dùng transformer đa phương thức với các thành phần chuyên biệt để chuyển ảnh, video và âm thanh thành biểu diễn chung nội bộ và sinh đầu ra. Một thành phần dành cho hành động là nền tảng cho ứng dụng robot; BFL nói phương pháp này cho chất lượng sinh và hiểu biết thế giới tốt hơn so với phương pháp flow-matching trước đây.

Nguồn

Đọc tiếp trong Tin AI