Kỹ Thuật Hậu Huấn Luyện Khiến Văn Bản Của LLM Dễ Bị Phát Hiện
1 phút đọc

Emi viết trong một bài đăng rằng về lý thuyết LLM có thể viết đa dạng như con người, nhưng thực tế thì không. Các biện pháp hậu huấn luyện và rào chắn an toàn khiến hệ thống học các quy tắc hành vi để tránh đầu ra nguy hiểm hoặc tự kiểm duyệt những phát ngôn chính trị, từ đó giới hạn phạm vi biểu đạt — hiện tượng ông gọi là "mode collapse".
Ông cho rằng các base model, tức model thô trước khi hậu huấn luyện, viết với đa dạng cao hơn nên công cụ phát hiện của Pangram thường không gắn cờ chúng. Tương tự, các tinh chỉnh hẹp chuyên vào tác phẩm của Hemingway hoặc nội dung từ một số subreddit, cũng như các đầu ra bị hỏng như văn bản vô nghĩa, đều có thể né được phát hiện.
Emi lưu ý rằng lập luận này chỉ áp dụng cho văn bản AI không có watermark. Watermark nhiều khả năng vẫn hoạt động ngay cả khi base model tạo ra văn bản đa dạng.
Nguồn
- LLMs could write like humans but post-training guardrails make their text detectable— The Decoder, 21 tháng 8, 2026