Làm Chủ AI
Tin AI

World Labs Ra Mắt Atlas, Model 3D Từ Ảnh

2 phút đọc

World Labs ra mắt Atlas, model 3D từ ảnh

World Labs do Fei-Fei Li đồng sáng lập nói Atlas là model đầu tiên của công ty được xây để làm việc này ở quy mô lớn. Công ty đặt mục tiêu vào trí thông minh không gian, tức AI hiểu 3D như con người.

Atlas là model đa năng được huấn luyện từ đầu trên văn bản, ảnh, video và dữ liệu 3D. Mỗi đầu vào được gắn với một vị trí cụ thể trong không gian 3D, thay vì đi qua một chuỗi phẳng.

Khi tạo hình theo điều khiển góc máy, Atlas nhận một hoặc nhiều ảnh rồi sinh ra góc nhìn mới ở vị trí và góc máy do người dùng chọn. Chuyển động máy ảnh được đưa vào như dữ liệu hình học trực tiếp, không phải bằng câu lệnh văn bản như nhiều model video khác.

Model có thể xuất video dài tới 1 phút ở 1440p. Người dùng có thể tự điều khiển từng cảnh, thay vì phải chấp nhận đầu ra ngẫu nhiên.

Ở phần dựng lại, Atlas có thể tái tạo cảnh thật từ chỉ 1 đến vài chục ảnh, không cần thiết bị chụp đặc biệt. Càng nhiều ảnh, model càng phải bù ít hơn bằng kiến thức của chính nó.

Trong một bản trình diễn, Atlas ghép dần Main Quad của Stanford từ 2 đến 25 ảnh chụp mặt đất và tạo góc nhìn từ trên cao. Công ty nói với 2 hoặc 3 ảnh, kết quả đã sát thực và vượt các model 3D chuyên biệt; model cũng xử lý hơn 100 đầu vào.

Atlas còn có thể xuất dữ liệu 3D thật, không chỉ ảnh hay video, vì nó xử lý độ sâu cùng RGB. Định dạng được hỗ trợ gồm đám mây điểm và các lát Gauss 3D. Trong so sánh trên OpenWorldLib, VGGT và InfiniteVGGT cho thấy sai lệch hình học và kết cấu mờ ngay khi máy ảnh di chuyển đáng kể.

Nguồn

Đọc tiếp trong Tin AI