Chuyển đến nội dung
tinAI
Quay lại

Kimi K3 trên MI355X: memory đang thành lợi thế inference

wafer.ai · Loại nguồn: công ty/blog 2026-08-02T20:07:47.997Z
Bản dịch tiếng Việt của tinAI · Từ Is memory the moat? | Wafer (wafer.ai) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Is memory the moat? | Wafer (wafer.ai)

Tác giả: Ian Ye

Ngày đăng: Dịch ngày:

TL;DR

Wafer cho thấy Kimi K3 2.8T có thể chạy hiệu quả trên 8x AMD MI355X nhờ dung lượng HBM lớn và một số sửa đổi trong speculative decode/prefill. Đây là datapoint hữu ích cho đội vận hành inference lớn, nhưng kết luận performance-per-dollar vẫn cần kiểm chứng bằng workload, correctness và chi phí thực tế.

Ước tính đọc: 4 phút

Tóm tắt

Wafer chạy Kimi K3 trên một node 8x AMD MI355X và lập luận rằng dung lượng HBM đang trở thành lợi thế thực tế khi phục vụ các open-weight model rất lớn. Bài viết có nhiều số đo hữu ích về throughput, speculative decode và prefill, nhưng kết luận về performance-per-dollar phụ thuộc mạnh vào giả định giá thuê GPU.

Kết quả chính

Kimi K3 là model 2.8T parameters, cần hơn 1.5TB VRAM trước khi tính KV cache cho context 1M token. Theo Wafer, cấu hình 8x MI355X có 288GB VRAM mỗi GPU, đủ để chạy Kimi K3 trên một node; một node 8x B200 thì không đủ, nên phải dùng hai node B200 hoặc chuyển sang B300.

Trong benchmark input 1.024 token và output 400 token, Wafer báo cáo:

Điểm dev nên để ý: đây là bài toán memory capacity và serving topology, không chỉ là so FLOPS. Khi model quá lớn để nằm gọn trong một node, interconnect và KV cache bắt đầu quyết định latency lẫn chi phí.

Cách Wafer tối ưu

Kimi K3 có thể chạy sẵn trên MI355X, nhưng Wafer vẫn phải sửa một số điểm trong stack ROCm/sglang.

Tối ưu đầu tiên là speculative decode. K3 không ship draft tensor kiểu MTP hay EAGLE, nên Wafer dùng draft model ngoài RadixArk Kimi-K3-DSpark. Trên ROCm, nhánh verifier của sglang bị lỗi vì top_k_renorm_prob không được định nghĩa. Wafer thay bằng một hàm PyTorch đơn giản: lấy top-k probability, zero các token còn lại, rồi renormalize tổng về 1. Sau khi sửa và harden speculative decode, họ báo single-stream nhanh hơn khoảng 2.2x và peak aggregate tăng 18%.

Tối ưu thứ hai nằm ở prefill. Wafer nhấn mạnh decode tok/s dễ được khoe quá mức, trong khi time-to-first-token mới là độ trễ người dùng cảm nhận. Với cold prefill 172k token, MI355X ban đầu mất khoảng 51 giây, còn B300 mất khoảng 23 giây. Nguyên nhân chính là AITER MLA prefill kernel không load vì shape mismatch: K3 ở TP8 có 12 attention heads mỗi rank, trong khi kernel hỗ trợ 4, 8 hoặc bội số của 16. Cách sửa là pad 12 head lên 16, chạy kernel nhanh, rồi lấy lại 12 head thật. Wafer nói steady-state prefill tăng từ khoảng 4-7k tok/s lên khoảng 13k tok/s.

Điều dev nên kiểm chứng

Bài viết đáng đọc nếu bạn vận hành inference cho model rất lớn, đặc biệt khi đang so AMD MI355X, NVIDIA B200 và B300. Tuy vậy, đừng bê nguyên kết luận performance-per-dollar vào kế hoạch mua hoặc thuê GPU nếu chưa kiểm tra lại các điều kiện sau:

Kết luận ngắn: memory đang là lợi thế thật của MI355X ở lớp model khổng lồ, nhưng “CUDA moat đã chết” vẫn là câu hỏi mở. Số đo này nên đi vào spreadsheet capacity planning, không nên đi thẳng vào slide chiến thắng.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Is memory the moat? | Wafer (wafer.ai) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 2 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (1 bài). Loại nguồn: web 1