Tóm tắt
Thử nghiệm reasoning prefill phiên bản 1.1 kiểm tra cách bốn open model phản ứng khi phần đầu reasoning của GPT-5.5 Pro được chèn vào reasoning channel. Kết quả nổi bật nhất thuộc về Qwen3.8 A95B: mức overlap với câu trả lời của teacher tăng 18,18 điểm phần trăm.
Đây là phần tiếp theo của thử nghiệm Reasoning prefills và dự án Stolen Thoughts. Tác giả xem độ dịch chuyển về phía câu trả lời của teacher như một tín hiệu có thể giúp điều tra quan hệ giữa các model, nhưng phép đo không tự nó xác nhận nguồn dữ liệu huấn luyện.
Phương pháp
Bộ evaluation gồm 45 bài, chia đều thành ba nhóm:
- 15 bài STEM;
- 15 bài non-STEM;
- 15 puzzle tổng hợp riêng.
Với mỗi bài, tác giả sinh hai response từ từng target model. Response thứ nhất chạy bình thường. Response thứ hai bắt đầu bằng 1% reasoning đầu tiên của GPT-5.5 Pro, được đưa thẳng vào reasoning channel của target model.
Phần trả lời nhìn thấy vẫn do target model tự sinh. Sau đó tác giả đo lượng nội dung từ câu trả lời nhìn thấy của teacher xuất hiện trong 100 token đầu của target. Score là trung bình recall theo unigram, bigram và trigram; delta là thay đổi tuyệt đối theo điểm phần trăm.
Bốn model được thử là DeepSeek V4 Flash, Inkling, Kimi K3 và Qwen3.8 A95B.
Phát hiện chính
| Model | Không prefill | Prefill từ GPT-5.5 Pro | Thay đổi |
|---|---|---|---|
| DeepSeek V4 Flash | 27,30% | 26,13% | −1,17 điểm |
| Inkling | 19,99% | 20,45% | +0,46 điểm |
| Kimi K3 | 31,11% | 35,65% | +4,54 điểm |
| Qwen3.8 A95B | 16,79% | 34,97% | +18,18 điểm |
Hiệu ứng của Qwen xuất hiện ở cả ba nhóm. STEM tăng 26,99 điểm, từ 19,26% lên 46,24%; non-STEM tăng 12,80 điểm, từ 20,62% lên 33,42%; puzzle tăng 14,75 điểm, từ 10,49% lên 25,23%.
Kimi K3 có overlap ban đầu cao nhất với GPT-5.5 Pro và vẫn cao sau prefill, nhưng mức tăng chỉ 4,54 điểm. DeepSeek gần như không đi theo teacher, còn Inkling chỉ tăng nhẹ.
Cách diễn giải
Trong thử nghiệm trước, Qwen hầu như không dịch về phía Opus 4.8. Với GPT-5.5 Pro, Qwen lại thay đổi mạnh, kể cả trên puzzle tổng hợp riêng. Tác giả cho rằng dữ liệu này phù hợp với khả năng Qwen đã học từ GPT-5.5 Pro hoặc một GPT model có quan hệ gần.
Tuy vậy, “phù hợp với” không đồng nghĩa chứng minh provenance. Prefill có thể tương tác với style reasoning, token distribution hoặc cấu trúc task theo nhiều cách. Bộ 45 bài cũng còn nhỏ để kết luận rộng về quá trình post-training của model.
Ý nghĩa với dev và researcher
Reasoning prefill là một probe hữu ích khi cần so hành vi ẩn giữa các model mà không chỉ nhìn final answer. Một evaluation chặt hơn nên có nhiều teacher, prefill đối chứng, nhiều tỷ lệ prefill, lặp lại theo seed và test riêng để loại trừ contamination.
Khi báo cáo kết quả, cần tách rõ ba lớp: overlap được đo trực tiếp, giả thuyết giải thích overlap và bằng chứng provenance độc lập. Cách tách này giúp phép thử đóng góp dữ liệu kỹ thuật mà không biến một tín hiệu thống kê thành cáo buộc chắc chắn.