Nvidia Đưa Groq 3 LPX Vào Sản Xuất, Công Bố Tốc Độ Kỷ Lục 3.400 Token/s
2 phút đọc

Nvidia giới thiệu Groq 3 LPX tại hội nghị Hot Chips 2026 và cho biết chip sẽ đi vào hoạt động trong năm nay. Hãng gọi đây là bộ gia tốc chuyên dành cho inference, mở rộng nền tảng Vera Rubin.
Một phép đo độc lập từ Artificial Analysis cho thấy cụm LPX đạt 3.400 token mỗi giây khi chạy Gemma 4 31B với cửa sổ ngữ cảnh 100.000 token, đo trên 50 yêu cầu liên tiếp và hiệu năng ổn định trong khoảng 10.000 đến 100.000 token đầu vào.
Nvidia so sánh con số này với chip của Cerebras và nói Groq 3 LPX nhanh gấp bốn lần, vì Cerebras đạt 882 token mỗi giây trong cùng phép so sánh. Công ty cũng nói với cấu hình rack, LPX có thể chứa tối đa 256 LPU được kết nối qua liên kết băng thông cao.
Các báo cáo nêu rõ kiến trúc của Groq dựa trên nhiều SRAM, mỗi LPU có 500 MB bộ nhớ, trong khi một GPU Vera Rubin có 288 GB; do đó model được chia trên nhiều gia tốc và trong một số trường hợp GPU xử lý giai đoạn tiền nạp còn LPUs xử lý giai đoạn giải mã.
Nvidia mua bản quyền công nghệ Groq khoảng 20 tỉ đô la vào cuối tháng 12 và đưa vào đội ngũ các nhà sáng lập Jonathan Ross cùng Sunny Madra. Nebius là nhà cung cấp đám mây đầu tiên dự kiến cung cấp chip thông qua Token Factory, và Groq cũng là một trong số người dùng sớm.
Nguồn
- Nvidia says its Groq 3 LPX is four times faster than Cerebras, but the math is more complicated— The Decoder, 25 tháng 8, 2026
- Nvidia’s dedicated inference accelerator Groq 3 LPX enters full production to supercharge AI agents— SiliconANGLE, 24 tháng 8, 2026