Làm Chủ AI
Tin AI

Nhóm Nghiên Cứu Tái Tạo Prompt LLM Từ Văn Bản Đầu Ra Với Độ Chính Xác Gần Như Hoàn Hảo

2 phút đọc

Nhóm nghiên cứu tái tạo prompt LLM từ văn bản đầu ra với độ chính xác gần như hoàn hảo

Phương pháp PTP hoạt động bằng cách huấn luyện một mô hình ngôn ngữ đảo ngược để dự đoán token trước đó thay vì token tiếp theo, đảo ngược cách LLM thông thường sinh văn bản. Mô hình đảo ngược được huấn luyện hoàn toàn từ đầu trên dữ liệu tổng hợp tạo ra từ chính LLM mục tiêu và chỉ cần văn bản sinh ra để huấn luyện.

Nghiên cứu cho thấy mô hình đảo ngược có thể tái tạo prompt gốc với độ chính xác rất cao. Trong một ví dụ, prompt "How to reach out to competitors to find their pricing strategies?" được khôi phục chữ một chữ y hệt, và mô hình cũng sinh ra sáu biến thể khác nhau bắt được ý chính nhưng dùng cách diễn đạt khác.

Nghiên cứu còn báo cáo rằng khi đưa các prompt tái tạo trở lại mô hình gốc, phản hồi gần giống với phản hồi ban đầu. Thử nghiệm trên mô hình nhỏ Qwen-3-0.6B cho thấy mô hình đảo ngược còn có thể tái tạo prompt từ phản hồi của GPT-4o; các prompt tái tạo không hoàn toàn giống nhưng nắm bắt được ý nghĩa và mục đích.

Bài báo nhắc tới rủi ro an ninh: phương pháp này có thể khiến các hệ thống lộ prompt chứa bí mật thương mại, quy tắc kiểm duyệt hoặc hướng dẫn chuyên biệt, và người dùng cá nhân có thể bị lộ các truy vấn nhạy cảm. Tác giả lưu ý một mô hình đảo ngược nhỏ, công khai cũng có thể đủ để thực hiện việc này.

Nguồn

Đọc tiếp trong Tin AI