Làm Chủ AI
Tin AI

Các Startup Tìm Lời Giải Cho Hạn Chế Của Transformer Trong LLM

2 phút đọc

Các startup tìm lời giải cho hạn chế của transformer trong LLM

Bài nằm trong loạt What’s Next của MIT Technology Review, xem xét các xu hướng và công nghệ tương lai. Tác giả nhắc lại năm 2017, các nhà nghiên cứu Google công bố bài “Attention Is All You Need” giới thiệu kiến trúc transformer, vốn trở thành lõi cho mọi LLM lớn hiện nay.

Transformer mạnh ở cơ chế gọi là dense attention, mã hóa ý nghĩa của một đoạn văn bằng dãy số và so sánh mọi token với mọi token khác. Cơ chế này giúp hiểu văn bản chính xác nhưng số phép tính tăng nhanh khi độ dài văn bản tăng, dẫn đến chi phí tính toán lớn.

MIT Technology Review nêu ví dụ: một văn bản dài 10.000 từ có thể khiến transformer phải thực hiện 50 triệu phép nhân. Bài viết dẫn con số OpenAI dự kiến chi 50 tỉ đô la cho tính toán trong năm nay, và Tổ chức Năng lượng Quốc tế dự đoán điện tiêu thụ của trung tâm dữ liệu sẽ tăng gấp đôi vào năm 2030.

Bên cạnh chi phí, transformer còn gặp hạn chế khi phải giữ nhiều thông tin cùng lúc; cửa sổ ngữ cảnh không thể mở quá rộng nên khó cho các nhiệm vụ cần xử lý lượng dữ liệu lớn như cả thư viện tài liệu, toàn bộ mã nguồn, hoặc đầu ra của các agent khác.

Vì vậy, nhiều nhà khoa học và kỹ sư đang hỏi what’s next — hướng phát triển tiếp theo cho LLM. MIT Technology Review gọi thế hệ mô hình tương lai là LLMs+ trong danh sách “10 điều quan trọng trong AI” năm nay, và nhận định các startup đang đua nhau thử nghiệm giải pháp mới.

Nguồn

Đọc tiếp trong Tin AI