Tin nổi bật
Speculative decoding trên AMD: tăng tốc không phải một nút bật
https://vllm.ai/blog/2026-08-23-speculative-decoding-amd-gpus
Bài viết của vLLM đo năm cách speculative decoding trên AMD Instinct MI300X và MI355X: native MTP, Gemma 4 MTP, EAGLE-3, DFlash và DSpark. Nhiều cấu hình vượt 2× throughput so với autoregressive baseline; mức cao được báo cáo gồm 2,87× với DFlash trên Gemma 4 26B và 2,68× trên Kimi K2.5. Nhưng dữ liệu quan trọng hơn nằm ở phần không đẹp: có cấu hình tăng ít hoặc chậm hơn baseline, còn độ dài proposal tốt nhất đổi theo model và workload. intothemild bổ sung một khoảng trống thực tế trên HN: vLLM gốc vẫn chạy R9700 workstation chậm hơn đáng kể so với các fork họ dùng. Mình xem đây là hướng tối ưu đáng benchmark, không phải preset để copy. Nếu đang serve model trên ROCm, hãy sweep num_speculative_tokens bằng prompt thật, rồi theo dõi throughput cùng mean accepted length và acceptance theo từng vị trí. Một acceptance rate đẹp vẫn có thể thua nếu draft network ăn hết phần latency tiết kiệm được.
Tool đáng thử trong sandbox
Coop nhốt coding agent trong VM dùng một lần. Repo của Trail of Bits cung cấp Rust CLI tạo VM cô lập để Claude Code hoặc Codex có Docker, git, compiler và package manager; backend là Firecracker trên Linux, Lima trên macOS. Mình thích blast radius nhỏ hơn, nhưng vẫn sẽ đọc trust model và giới hạn credential trước khi trao quyền tự động.
Giới hạn thuê bao là dependency biến động
Một thread HN báo giới hạn phiên 5 giờ quay lại. Trong cuộc thảo luận 119 bình luận, watty nói các đợt làm side project giờ dễ chạm trần dù quota tuần từng đủ. Nguồn không có thông báo chính thức, nên mình không coi đó là policy đã xác minh; mình chỉ coi đó là lý do giữ workflow và fallback không khóa vào một gói thuê bao.
— Tin