Bộ Consortium Đức Công Bố Soofi S Bản 3.0, Phát Hiện Ô Nhiễm Dữ Liệu Kiểm Tra Trong Tập QA-base
2 phút đọc

Báo cáo phiên bản 3.0 ghi nhận tập QA-base, vốn chỉ nên chứa các câu hỏi luyện tập được diễn đạt lại từ 25 bộ benchmark chuẩn, thực tế có bao gồm các câu hỏi diễn đạt lại từ bộ kiểm tra GPQA, gồm biến thể GPQA Diamond, bằng tiếng Anh và bản dịch máy sang tiếng Đức.
Nguyên nhân được truy vết đến cách gán nhãn phân chia của GPQA trên Hugging Face: bộ benchmark không có tập huấn luyện riêng và toàn bộ tài liệu kiểm tra nằm dưới nhãn mặc định "train", nên đường dẫn dữ liệu đã chọn nhầm các câu kiểm tra vào tập luyện.
Một cuộc kiểm toán đầy đủ sau khi phát hiện ra lỗi tìm thêm ba benchmark khác có cùng mô hình nhãn (TruthfulQA, BLiMP và Inverse Scaling), dù ba bộ này không được dùng trong đánh giá Soofi-S. Consortium đã loại GPQA hoàn toàn khỏi bộ đánh giá và tính lại kết quả so sánh cho 16 model để giữ tính công bằng; theo tác giả, thứ tự xếp hạng không đổi.
Báo cáo cho biết tiến trình cải thiện điểm trên các tác vụ GPQA bị ảnh hưởng diễn ra đều đặn, từ 32.3 lên 43.4 điểm, và không có một đột biến bất thường khi huấn luyện, nên vấn đề không bị phát hiện trước. Để ngăn tái diễn, nhóm giờ tự động đối chiếu dữ liệu huấn luyện với toàn bộ câu hỏi kiểm tra thay vì chỉ dựa vào nhãn phân chia.
Các thành viên dự án như Nicolas Flores Herr từ Fraunhofer IAIS nói rằng sự cố cho thấy cách tiếp cận mã nguồn mở có lợi, vì cộng đồng chỉ phát hiện vấn đề nhờ dữ liệu được công khai. Nhóm cũng cho biết đã công bố khoảng 152000 kết quả riêng lẻ để kiểm chứng, và một đánh giá riêng bởi đối tác Ellamind dùng dữ liệu kiểm tra bị giữ riêng khẳng định kết quả.
Nhóm cho biết các biến thể đã tinh chỉnh theo hướng chỉ dẫn và suy luận đang trong giai đoạn thử nghiệm beta và dự kiến phát hành dưới giấy phép cho phép trong vài tuần tới, trong khi model lớn hơn Soofi L đang ở giai đoạn huấn luyện.
Nguồn
- German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and German— The Decoder, 24 tháng 7, 2026