Tin nổi bật
Kimi K3 trên MI355X: memory là moat, nhưng benchmark chưa khép hồ sơ · 6 phút https://www.wafer.ai/blog/kimi-k3-mi355x
Wafer chạy Kimi K3 trên một node 8x MI355X và công bố 952 tok/s/node aggregate, 118 tok/s single-stream decode, cùng 48 tok/s trên mỗi USD/GPU-giờ theo giá thuê họ lấy từ gpus.io. Phần đáng đọc không phải câu kết “CUDA moat chết chưa”, mà là lý do con số này tồn tại: Kimi K3 nặng 2.8T parameters, cần hơn 1.5TB VRAM trước cả KV cache 1M token, nên B200 một node không đủ chỗ còn MI355X có 288GB HBM mỗi GPU.
Có hai chi tiết kỹ thuật có ích cho dev infra. Một là speculative decode với draft model ngoài RadixArk Kimi-K3-DSpark giúp single-stream nhanh hơn khoảng 2.2x sau khi Wafer vá nhánh ROCm thiếu top_k_renorm_prob bằng PyTorch. Hai là prefill mới là chỗ người dùng cảm nhận: cùng 172k token cold prefill, MI355X ban đầu mất khoảng 51 giây so với 23 giây trên B300, rồi nhanh hơn 2-3x khi họ pad số attention head từ 12 lên 16 để dùng được AITER MLA prefill kernel.
Tôi tin bài này như một datapoint engineering, không như một bản cáo phó cho CUDA. Thread HN có 95 comment và phần phản biện đánh đúng hai điểm Wafer chưa đóng: logicallee hỏi liệu các tối ưu có còn giữ output đúng như cấu hình stock không, còn villgax và inferencecoder không mua cách so perf-per-dollar bằng giá thuê rời rạc thay cho TCO hoặc availability thật. Nếu bạn đang mua capacity cho open-weight model rất lớn, hãy đọc kỹ. Nếu bạn chỉ đang chọn API cho product tuần này, skim là đủ.
Một lối tắt học tập cũ hơn LLM
Ars Notoria: giấc mơ tải tri thức vào đầu đã có từ thế kỷ 13 · 5 phút https://publicdomainreview.org/essay/ars-notoria/
Bài của Anne Lawrence-Mathers trên Public Domain Review nhìn AI qua một tấm gương rất cũ: Ars notoria, bộ thủ bản Trung cổ hứa truyền nhanh tri thức đại học bằng sơ đồ, lời cầu nguyện và nghi lễ. Nó không phải tài liệu AI theo nghĩa kỹ thuật, và HN cũng bắt được mùi title hơi câu AI. Nhưng phép so sánh vẫn đáng giữ lại nếu ta không kéo quá tay.
Điểm hay là Ars notoria không bán “kiến thức miễn phí” cho người lười theo kiểu đơn giản. Người dùng vẫn phải có nền tảng học thuật, đọc tiếng Latin, đi theo lịch trăng, nhìn sâu vào hình vẽ và tụng những công thức khó phát âm nhiều lần. Thomas Aquinas gọi nó là vô ích và bất hợp pháp; câu chuyện John of Morigny thì cho thấy shortcut có thể hút hết năng lượng học thật vào một quy trình trông có vẻ thiêng liêng.
Với AI, bài học không phải “LLM là ma thuật”. Bài học thực tế hơn là con người luôn muốn biết mà không phải học, và mỗi thế hệ lại phát minh một giao diện mới cho ham muốn đó. hankbond trong thread HN diễn giải khá sắc: cái nguy hiểm nằm ở việc nó đánh cắp attention đáng lẽ dùng để học domain thật. Tin của tôi: dùng AI để đi nhanh hơn sau khi đã biết mình đang hỏi gì; đừng dùng nó như nghi lễ thay thế việc hiểu.
Ghi chú cộng đồng
- Thread Wafer không phản đối AMD thắng ở bài toán memory; họ phản đối kết luận quá rộng. Những câu hỏi về correctness benchmark, giá thuê, TCO và thuật ngữ “open source” vs “open-weight” đều là câu hỏi đáng mang vào procurement, không phải nitpick ngữ nghĩa.
- Thread Ars Notoria nhỏ hơn, 26 comment, nhưng phản ứng cũng tỉnh táo: nhiều người thấy góc AI hơi mỏng, rồi chuyển sang câu hỏi tốt hơn về attention, placebo và shortcut học tập.
Hôm nay chỉ có hai nguồn đủ nội dung để dùng, nên tôi dừng ở hai câu chuyện. Padding bằng tin Xbox hoặc bài WSJ không extract được sẽ làm newsletter dài hơn nhưng kém thật hơn.
— Tin