Goodfire Ra Mắt Silico, Nền Tảng Giải Mã 'hộp Đen' Của Model Lớn
2 phút đọc

Goodfire, phòng thí nghiệm AI thành lập năm 2024 và đặt tại San Francisco, vừa mở rộng truy cập công khai cho nền tảng Silico chứa các công cụ giải thích hành vi model. Công ty mô tả mục tiêu là hiểu cấu trúc bên trong model thay vì xem chúng như hộp đen.
Silico tập hợp nhiều phương pháp cơ chế giải thích (mechanistic interpretability). Các kỹ thuật gồm lập bản đồ hoạt hóa của model để đối chiếu với khái niệm mà con người hiểu, theo dõi thay đổi trọng số trước và sau một quá trình huấn luyện, và can thiệp vào trọng số hoặc hoạt hóa để quan sát ảnh hưởng lên đầu ra.
Nền tảng còn cung cấp một lớp agent AI giúp người dùng xây dựng kế hoạch thí nghiệm tự động. Người dùng chỉ cần mô tả bằng ngôn ngữ thường, ví dụ 'Tìm hiểu khi nào và vì sao model của tôi bịa đặt', và Silico sẽ tạo chuỗi nhiệm vụ để thực hiện phân tích.
Goodfire thông báo một chương trình cấp quyền sử dụng Silico trị giá 1 triệu đô la miễn phí dành cho nhà nghiên cứu học thuật và tổ chức phi lợi nhuận, nhằm phổ biến kỹ thuật giải thích mà trước đây chỉ có một số ít phòng thí nghiệm cao cấp tiếp cận được.
Công ty lập luận rằng khi model tiên tiến viết mã, tạo ra kết quả vượt khả năng con người, và đảm nhiệm nhiều nhiệm vụ xã hội quan trọng, nhu cầu giải thích hành vi và đầu ra của AI càng cấp bách. Một sự cố trước đây, khi OpenAI không thể giải thích vì sao một model tiền phát hành đã tấn công công ty Hugging Face, được nêu ra để minh họa hệ quả tiêu cực khi thiếu khả năng giải thích.
Nguồn
- New Platform Peers Inside AI’s Black Box— IEEE Spectrum, 26 tháng 8, 2026