Làm Chủ AI
Tin AI

Kog Tối Ưu Phần Mềm Để Tăng Tốc Inference Trên GPU Thông Thường

2 phút đọc

Kog tối ưu phần mềm để tăng tốc inference trên GPU thông thường

Kog công bố bản demo nhằm chứng minh có thể đạt xử lý giải mã một yêu cầu rất nhanh trên GPU datacenter thông dụng như AMD MI300X và Nvidia H200. Bản demo sử dụng GPU nói trên và model Laneformer 2B, một model nhỏ khoảng 2 tỉ tham số.

Demo của Kog đạt 3.000 token mỗi giây trên mỗi yêu cầu (TPS) với model Laneformer 2B. Công ty đặt mục tiêu xa hơn, hứa hẹn sẽ giúp đạt mức “30x nhanh hơn cho inference của LLM”.

CEO Gaël Delalleau cho biết công ty nhận được phản hồi mạnh và “200 lead kinh doanh” sau khi trình diễn. Kog nhắm tới khách hàng doanh nghiệp chịu tổn thất do độ trễ cao trong quy trình AI chuyên nghiệp, đồng thời có đối tác thiết kế cho phép tạo game và app bằng prompt.

Sau phản hồi ban đầu, Kog tập trung vào tăng tốc phát triển các model lớn hơn để đáp ứng nhu cầu. Delalleau cho rằng GPU vẫn có tương lai tốt nhờ băng thông bộ nhớ ngày càng cao, và phần mềm tối ưu có thể khai thác khả năng đó.

Kog được đặt cạnh các nỗ lực khác về tối ưu phần mềm cho inference trên nhiều loại chip, trong khi công ty so sánh phương pháp của mình với công trình ở phòng thí nghiệm Hazy Research của Stanford về tập trung sâu vào tăng tốc GPU.

Nguồn

Đọc tiếp trong Tin AI