Chuyển đến nội dung
tinAI
Quay lại

Reasoning prefill: vì sao Qwen3.8 dịch mạnh về phía GPT-5.5 Pro

gist.github.com · Loại nguồn: GitHub 2026-09-09T20:12:49.373Z
Bản dịch tiếng Việt của tinAI · Từ Reasoning prefills on a few open models, v1.1 (gist.github.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Reasoning prefills on a few open models, v1.1 (gist.github.com)

Tác giả: wsxiaoys

Ngày đăng: Dịch ngày:

TL;DR

Khi 1% reasoning của GPT-5.5 Pro được prefill, overlap trong 100 token đầu của Qwen3.8 A95B tăng từ 16,79% lên 34,97% trên 45 bài. Hiệu ứng là một probe đáng chú ý về quan hệ hành vi giữa model, nhưng chưa đủ để tự chứng minh provenance của dữ liệu huấn luyện.

Ước tính đọc: 3 phút

Tóm tắt

Thử nghiệm reasoning prefill phiên bản 1.1 kiểm tra cách bốn open model phản ứng khi phần đầu reasoning của GPT-5.5 Pro được chèn vào reasoning channel. Kết quả nổi bật nhất thuộc về Qwen3.8 A95B: mức overlap với câu trả lời của teacher tăng 18,18 điểm phần trăm.

Đây là phần tiếp theo của thử nghiệm Reasoning prefills và dự án Stolen Thoughts. Tác giả xem độ dịch chuyển về phía câu trả lời của teacher như một tín hiệu có thể giúp điều tra quan hệ giữa các model, nhưng phép đo không tự nó xác nhận nguồn dữ liệu huấn luyện.

Phương pháp

Bộ evaluation gồm 45 bài, chia đều thành ba nhóm:

Với mỗi bài, tác giả sinh hai response từ từng target model. Response thứ nhất chạy bình thường. Response thứ hai bắt đầu bằng 1% reasoning đầu tiên của GPT-5.5 Pro, được đưa thẳng vào reasoning channel của target model.

Phần trả lời nhìn thấy vẫn do target model tự sinh. Sau đó tác giả đo lượng nội dung từ câu trả lời nhìn thấy của teacher xuất hiện trong 100 token đầu của target. Score là trung bình recall theo unigram, bigram và trigram; delta là thay đổi tuyệt đối theo điểm phần trăm.

Bốn model được thử là DeepSeek V4 Flash, Inkling, Kimi K3 và Qwen3.8 A95B.

Phát hiện chính

ModelKhông prefillPrefill từ GPT-5.5 ProThay đổi
DeepSeek V4 Flash27,30%26,13%−1,17 điểm
Inkling19,99%20,45%+0,46 điểm
Kimi K331,11%35,65%+4,54 điểm
Qwen3.8 A95B16,79%34,97%+18,18 điểm

Hiệu ứng của Qwen xuất hiện ở cả ba nhóm. STEM tăng 26,99 điểm, từ 19,26% lên 46,24%; non-STEM tăng 12,80 điểm, từ 20,62% lên 33,42%; puzzle tăng 14,75 điểm, từ 10,49% lên 25,23%.

Kimi K3 có overlap ban đầu cao nhất với GPT-5.5 Pro và vẫn cao sau prefill, nhưng mức tăng chỉ 4,54 điểm. DeepSeek gần như không đi theo teacher, còn Inkling chỉ tăng nhẹ.

Cách diễn giải

Trong thử nghiệm trước, Qwen hầu như không dịch về phía Opus 4.8. Với GPT-5.5 Pro, Qwen lại thay đổi mạnh, kể cả trên puzzle tổng hợp riêng. Tác giả cho rằng dữ liệu này phù hợp với khả năng Qwen đã học từ GPT-5.5 Pro hoặc một GPT model có quan hệ gần.

Tuy vậy, “phù hợp với” không đồng nghĩa chứng minh provenance. Prefill có thể tương tác với style reasoning, token distribution hoặc cấu trúc task theo nhiều cách. Bộ 45 bài cũng còn nhỏ để kết luận rộng về quá trình post-training của model.

Ý nghĩa với dev và researcher

Reasoning prefill là một probe hữu ích khi cần so hành vi ẩn giữa các model mà không chỉ nhìn final answer. Một evaluation chặt hơn nên có nhiều teacher, prefill đối chứng, nhiều tỷ lệ prefill, lặp lại theo seed và test riêng để loại trừ contamination.

Khi báo cáo kết quả, cần tách rõ ba lớp: overlap được đo trực tiếp, giả thuyết giải thích overlap và bằng chứng provenance độc lập. Cách tách này giúp phép thử đóng góp dữ liệu kỹ thuật mà không biến một tín hiệu thống kê thành cáo buộc chắc chắn.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Reasoning prefills on a few open models, v1.1 (gist.github.com) · Loại nguồn: GitHub và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: công ty/blog 2