Chuyển đến nội dung
tinAI
Quay lại

WASTE: stream Kimi K3 2,78T từ NVMe trên máy cá nhân

github.com · Loại nguồn: GitHub 2026-08-01T20:07:42.308Z
Bản dịch tiếng Việt của tinAI · Từ GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine. (github.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine. (github.com)

Tác giả: sqliteai

Ngày đăng: Dịch ngày:

TL;DR

WASTE là inference engine C cho phép chạy Kimi K3 2,78T bằng cách giữ trunk trong RAM và stream expert weights từ NVMe. Nó chứng minh tính khả thi của local inference cho model rất lớn, nhưng tốc độ 0,45-0,62 token/giây nghĩa là đây là bài học kiến trúc hơn là trải nghiệm chat thoải mái.

Ước tính đọc: 2 phút

Giới thiệu

WASTE, viết tắt của Weight-Aware Streaming Tensor Engine, là một inference engine C không phụ thuộc runtime bên thứ ba. Mục tiêu của repo là chạy model MoE cực lớn khi toàn bộ weights không thể nằm trong RAM của máy phổ thông.

Proof point hiện tại là Kimi K3 2,78 nghìn tỷ tham số. Model gốc khoảng 1,42 TB, được convert thành container khoảng 982 GiB, rồi chạy trên MacBook Pro 64 GB với tốc độ được báo cáo 0,45-0,62 token/giây.

Cơ chế chính

WASTE giữ phần trunk của model trong RAM, đặt expert weights trên NVMe, và dùng phần RAM còn lại làm expert cache. Vì Kimi K3 là mixture-of-experts, mỗi token chỉ kích hoạt một phần nhỏ weights; engine chỉ đọc phần expert cần thiết thay vì cố nhét cả model vào bộ nhớ.

Repo nêu hai tối ưu quan trọng: overlap đọc expert với phép tính, và prefetch expert cho layer tiếp theo dựa trên dự đoán router. Cách này tăng hit rate cache từ 14% lên 38% trong số đo của tác giả mà không thay đổi logits.

Yêu cầu thực tế

Dev nên quan tâm vì

Nếu bạn cần model local vì dữ liệu không thể rời máy, WASTE cho thấy một hướng kỹ thuật: tối ưu layout weights và lịch đọc thay vì chỉ nói “mua GPU lớn hơn”. Điều đó không biến laptop thành cluster, nhưng nó mở một đường debug và thử nghiệm cho những model trước đây chỉ nằm trong datacenter.

Điểm cần tỉnh táo là tốc độ. 0,5 token/giây đủ cho demo, batch job chậm, hoặc nghiên cứu inference; nó chưa phải lựa chọn tốt cho assistant tương tác. Với model nhỏ hơn như Kimi-Linear 48B, repo nói cùng engine đạt 10,7 token/giây từ container 19 GiB, thực dụng hơn nhiều cho người muốn thử trước.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine. (github.com) · Loại nguồn: GitHub và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: công ty/blog 2