Chuyển đến nội dung
tinAI
Quay lại

Explorative Modeling và best-of-K

alexiglad.github.io · Loại nguồn: công ty/blog 2026-08-01T20:08:16.119Z
Bản dịch tiếng Việt của tinAI · Từ Alexi Gladstone | Explorative Modeling -- Unlocking a Third Pretraining Axis and End-to-End Generation (alexiglad.github.io) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Alexi Gladstone | Explorative Modeling -- Unlocking a Third Pretraining Axis and End-to-End Generation (alexiglad.github.io)

Tác giả: Alexi Gladstone

Ngày đăng: Dịch ngày:

TL;DR

Explorative Modeling đề xuất cho model sinh nhiều dự đoán rồi train trên dự đoán gần dữ liệu nhất, nhằm tránh việc học ra đáp án trung bình vô dụng khi có nhiều đáp án đúng. Tác giả claim cải thiện sample efficiency, FLOP efficiency và giảm inference compute trên một số control tasks, nhưng novelty cần đọc cùng prior work về winner-take-all và best-of-N.

Ước tính đọc: 2 phút

Tóm tắt

Explorative Modeling bắt đầu từ một vấn đề quen thuộc của generative modeling: khi dữ liệu có nhiều đáp án đúng, một model bị ép dự đoán một đáp án duy nhất sẽ học ra trung bình. Với ảnh, trung bình đó thành blur; với text, nó có thể thành output nghèo nàn và lặp.

Các hệ model hiện nay né lỗi này bằng cách factor generation thành nhiều bước nhỏ. Autoregressive model dự đoán token tiếp theo; diffusion model đi từ noise qua nhiều bước denoising. Explorative Models đề xuất một trục khác: cho model tạo K phương án và train trên phương án khớp dữ liệu nhất.

Phát hiện chính

Ý nghĩa với Dev

Nếu bạn build model hoặc đánh giá model generation, thông điệp thực dụng là đừng chỉ nhìn loss trung bình. Nhiều bài toán có nhiều output đúng, và metric huấn luyện sai có thể thưởng cho phương án “an toàn” nhưng vô dụng.

Best-of-K nghe đơn giản, nhưng nó đổi cách nghĩ về dữ liệu và compute: bạn trả thêm chi phí trong training để model học nhiều mode hơn, đổi lại có thể giảm số bước hoặc tăng chất lượng ở inference. Với app layer, cùng trực giác này giải thích vì sao self-consistency, reranking và verifier thường cải thiện output hơn một prompt dài hơn.

Caveat

Thread HN nhắc đúng rằng ý tưởng winner-take-all, Importance Weighted Autoencoders, minibatch optimal transport và best-of-N fine-tuning đều có lịch sử. Vì vậy nên đọc bài này như một cách đóng gói và scale một hướng nghiên cứu, không phải phát minh xuất hiện từ hư không.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Alexi Gladstone | Explorative Modeling -- Unlocking a Third Pretraining Axis and End-to-End Generation (alexiglad.github.io) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: GitHub 1