Làm Chủ AI
Tin AI

Deepmind Ra GenCeption: Dùng Mô Hình Tạo Video Cho Nhiệm Vụ Thị Giác Máy Tính

2 phút đọc

Deepmind ra GenCeption: dùng mô hình tạo video cho nhiệm vụ thị giác máy tính

GenCeption dựa trên mô hình video Wan2.1 của Alibaba và thay đổi chính là kiến trúc đơn giản hơn: thay vì sinh video qua nhiều bước khuếch tán, mô hình dự đoán trong một lượt tiến tới, giúp nhanh hơn cho các bài toán thị giác.

Nhóm nghiên cứu biểu diễn mọi đầu ra dưới dạng ảnh RGB ba kênh chuẩn, dù đó là bản đồ chiều sâu, bản đồ pháp tuyến bề mặt hay mặt nạ phân đoạn. Chuyển động của camera cũng được mã hóa thành biểu diễn ảnh. Một lời nhắc chữ cho biết nhiệm vụ cần thực hiện, tương tự chỉ dẫn cho một chatbot, và các module có thể huấn luyện được được thêm để dự đoán các điểm mốc 3D.

Huấn luyện dùng một hàm mất mát chung cho tất cả nhiệm vụ, thay vì thay đổi kiến trúc theo từng nhiệm vụ; dữ liệu huấn luyện được xử lý để phù hợp yêu cầu riêng của từng nhiệm vụ. Phần lớn dữ liệu huấn luyện là tập dữ liệu tổng hợp gồm 7.500 video: kết hợp 800 mẫu người số với 200 chuỗi chuyển động từ một bộ dữ liệu bắt chuyển động, sau đó render trong Blender với phông nền và góc máy khác nhau. Video thực tế chỉ được dùng cho phân đoạn hướng dẫn bằng ngôn ngữ.

Theo bài báo, GenCeption đạt tương đương hoặc vượt các kết quả tốt nhất trên nhiều phép đo: ước lượng chiều sâu tương đương DepthAnything 3; vượt NormalCrafter và Lotus-2 ở ước lượng pháp tuyến bề mặt; vượt Genmo và TRAM ở nhận dạng tư thế 3D; và ở phân đoạn phức tạp theo ngôn ngữ, đạt mức tương đương với SAM 3 kết hợp Gemini 3.5 Flash.

Nguồn

Đọc tiếp trong Tin AI