Chuyển đến nội dung
tinAI
Quay lại

DiffusionGemma: model text diffusion 26B của Google, nhanh hơn autoregressive 4x

blog.google · Loại nguồn: web 2026-06-10T23:06:43.660Z
Bản dịch tiếng Việt của tinAI · Từ DiffusionGemma: 4x faster text generation (blog.google) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: DiffusionGemma: 4x faster text generation (blog.google)

Tác giả: Brendan O'Donoghue, Sebastian Flennerhag

Ngày đăng: Dịch ngày:

TL;DR

Google ra DiffusionGemma — model experimental 26B MoE (Apache 2.0) sinh text bằng diffusion thay vì autoregressive. Trên H100 đạt 1000+ tokens/s, RTX 5090 đạt 700+ tokens/s. Chất lượng thấp hơn Gemma 4 chuẩn — dành cho dev prototype low-latency local workflow, không production.

Ước tính đọc: 3 phút

Có gì mới

DiffusionGemma là model open experimental 26B Mixture of Experts (active 3.8B params lúc inference), Apache 2.0 license, sinh text bằng text diffusion thay vì autoregressive token-by-token. Trên GPU dedicated, inference nhanh hơn Gemma 4 autoregressive 4x.

Build trên Gemma 4 family với head diffusion mới được tune để tối ưu speed. Tác giả nói rõ: standard Gemma 4 vẫn là choice cho production output quality cao, DiffusionGemma dành cho researcher và developer làm speed-critical interactive local workflow — in-line editing, rapid iteration, sinh non-linear text structure.

Tính năng chính

Cách hoạt động

Giống image diffusion bắt đầu từ noise và refine ra image rõ, text diffusion hoạt động tương tự:

  1. Canvas: model bắt đầu với canvas gồm placeholder token random.
  2. Iterative refinement: nhiều pass, lock các token đúng và dùng chúng làm context để refine phần còn lại.
  3. Final polish: text converge thành output chất lượng cao.

Vì model xử lý nguyên paragraph khi generate, mở ra pattern mới — đóng markdown complex hoàn hảo, sinh và render code gần real-time.

Khi nào không nên dùng

DiffusionGemma được design cho local và low-concurrency inference. Trong cloud serving high-QPS, model autoregressive saturate compute hiệu quả, parallel decoding của DiffusionGemma diminishing returns và có thể tốn cost hơn. Throughput advantage mạnh nhất ở batch size thấp-trung bình trên single accelerator.

Nếu bạn serve cho hàng ngàn user qua API, stick với Gemma 4 autoregressive.

Cách bắt đầu

Khi nào nên thử

Không nên dùng nếu cần quality production hay serve high-QPS qua API.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ DiffusionGemma: 4x faster text generation (blog.google) · Loại nguồn: web và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1