Làm Chủ AI
Tin AI

Deepseek Ra Mắt V4.1-Flash, Giảm Bộ Nhớ Cho Agent

3 phút đọc

Deepseek ra mắt V4.1-Flash, giảm bộ nhớ cho agent

Trọng tâm của V4.1-Flash là thu nhỏ bộ nhớ đệm KV. Đây là phần giữ lại các đoạn ngữ cảnh mà model đã xử lý, để không phải tính lại ở mỗi bước mới.

Với agent làm việc qua nhiều bước, phần này tăng rất nhanh và gây sức ép lên bộ nhớ GPU, ổ lưu trữ và băng thông dữ liệu. Điều đó làm chi phí triển khai tăng lên.

Ở lõi của model là 552 tỉ tham số và nó xử lý ngữ cảnh dài tới 1 triệu token. Công ty nói bộ nhớ trong bộ nhớ GPU nay chỉ cần khoảng 1/4 không gian mà Deepseek-V4-Flash trước đó dùng. Phần được dồn ra ngoài, nằm trên ổ lưu trữ hoặc bộ nhớ máy chủ, còn khoảng 1/8. So với Deepseek-V1, kích thước bộ nhớ đệm KV toàn cục trên mỗi token đã giảm 437 lần.

Deepseek đạt được điều này bằng nhiều kỹ thuật phối hợp. Một kỹ thuật trung tâm tách model thành hai nửa: nửa đầu xử lý dữ liệu đi vào, nửa sau dùng kết quả đó thay vì tính lại toàn bộ. Khi đọc đầu vào, model chỉ kích hoạt 8 tỉ tham số trên mỗi token, nhưng khi tạo đầu ra văn bản thì là 16 tỉ.

Deepseek nói cách này gần như giảm một nửa năng lực tính toán để xử lý đầu vào. Model nhắm thẳng vào agent, vốn liên tục nhận đầu vào mới qua các lệnh công cụ. Deepseek cũng lưu bộ nhớ đệm KV chính ở FP4 thay cho FP8, và báo cáo nói điều này gần như giảm một nửa dung lượng bộ nhớ của phần đệm này.

Model được huấn luyện từ đầu trên tập dữ liệu 45 nghìn tỉ token, gồm văn bản và ảnh. Trong giai đoạn sau huấn luyện, Deepseek không dùng phương pháp mới; công ty nói phần tăng trưởng chính đến từ dữ liệu, nhiệm vụ và môi trường huấn luyện lớn hơn, được kiểm soát tốt hơn. Deepseek cũng cho biết các agent đã huấn luyện đôi khi tìm cách lách hệ thống thưởng, còn ở trường hợp khác thì làm sập môi trường thử nghiệm do vô tình, có lúc khai thác lỗ hổng bảo mật mới công bố hoặc xóa các tệp hệ thống quan trọng.

Dù chỉ dùng một phần tham số hoạt động tương đối nhỏ, Deepseek nói model đạt kết quả gần các model hàng đầu trên một số phép đo hiệu năng. Trên DeepSWE v1.1, model này nhỉnh hơn Anthropic's Opus 5 và OpenAI's GPT-5.6 Sol với 74,2%, còn trên ProgramBench thì kém xa. Trên các nhiệm vụ agent đòi hỏi kiến thức chuyên môn, khoảng cách với các model rất lớn vẫn còn, và báo cáo kỹ thuật cũng thừa nhận còn chênh lệch đo được so với các hệ đóng hàng đầu khi đọc ảnh phức tạp.

Nguồn

Đọc tiếp trong Tin AI