Tin nổi bật
Shai-Hulud quay lại qua keyv: đây là kiểu sự cố npm phải xử lý ngay · 8 min https://www.aikido.dev/blog/keyv-and-friends-compromised-in-npm-supply-chain-attack
Aikido nói ngày 4/8/2026, tài khoản GitHub của maintainer đứng sau keyv bị chiếm, rồi kẻ tấn công đẩy mã độc thẳng lên main và cắt release mới cho cả một họ package cache phổ biến. Bản bị đầu độc thêm script preinstall, tải Bun, chạy Math_Symbol.js, quét npm token, GitHub token, AWS credential, Kubernetes secret, Vault token, Stripe/Slack token và file cấu hình nhạy cảm. Bài gốc ghi nhận ít nhất 434 package qua 1.381 version đã bị ảnh hưởng, với tổng lượt cài hàng tháng hơn 2 tỷ theo số liệu package.
Tin đọc đây là câu chuyện bảo mật phần mềm trước, AI sau, nhưng nó đáng làm lead cho dev dùng AI vì payload còn chạm thẳng vào môi trường làm việc hiện đại: VS Code task, Claude Code settings, GitHub Actions token, npm publish token. Trên HN, xnorswap đẩy điểm thực dụng nhất: package tự nhiên thêm hook cài đặt nên bị coi là cực kỳ đáng ngờ. vlovich123 cũng đúng khi nhắc rằng lượt cài hàng tháng không đồng nghĩa số máy thật sự bị lộ secret; nhiều lượt chạy ở CI có thể không giữ credential quan trọng. Hai ý đó không làm sự cố nhẹ đi. Nó chỉ chuyển câu hỏi từ “con số có to không?” sang “máy dev và runner nào đã chạy version độc?”.
Nếu repo JavaScript của bạn có keyv, flat-cache, file-entry-cache, cacheable-request, cache-manager hoặc package phụ thuộc cùng họ trong lockfile, việc nên làm là kiểm tra version, audit lifecycle scripts, rotate token trên môi trường đã chạy npm install trong cửa sổ rủi ro, và coi provenance hợp lệ là chưa đủ. Signed release từ GitHub Actions không cứu được bạn khi chính account/release path đã bị chiếm.
Công cụ và mô hình
LLM thưởng cho người biết việc, không thưởng cho người bấm prompt dài hơn · 6 min https://www.seangoedecke.com/llms-reward-expertise/
Sean Goedecke viết một ý không mới nhưng hôm nay có bằng chứng cộng đồng khá tốt: kỹ năng quan trọng nhất khi dùng LLM là hiểu domain mà bạn đang hỏi. Ví dụ Terence Tao nói chuyện với ChatGPT về phản ví dụ của Jacobian Conjecture không giống một prompt template thần kỳ; ông biết phải giữ đoạn nào, nghi ngờ chỗ nào, và đổi hướng bằng câu hỏi ngắn.
Phần HN làm bài này đáng đọc hơn. walrus01 tóm rất gọn rằng LLM thưởng cho kiến thức kiến trúc: biết cấu trúc vấn đề và biết đừng bảo model “làm Microsoft Flight Simulator, không được sai”. natsucks cũng chạm đúng nỗi đau của agent: muốn hỏi câu đúng thì bạn phải đủ hiểu vấn đề. Tin đồng ý với kết luận, nhưng thêm một vế: LLM có thể giúp người mới tạo ra thứ đầu tiên; nó không tự biến họ thành người chịu trách nhiệm tốt cho hệ thống cuối cùng. Đọc bài này nếu đội của bạn đang nhầm “AI giúp dev yếu ít bế tắc hơn” với “expertise hết giá trị”.
Soup kéo fine-tune 8B xuống laptop GPU 4 GB, nhưng vẫn là beta · 5 min https://github.com/MakazhanAlpamys/Soup
Soup là CLI fine-tune/post-train LLM bằng một file YAML. Phần mới cần để mắt là layer streaming: giữ base model đông lạnh ngoài VRAM, đưa từng decoder layer lên GPU, và chỉ train adapter. README báo Llama-3.1-8B-Instruct với NF4, LoRA, batch 1, seq 512 trên RTX 3050 Laptop 4 GB đạt 3,32 GB peak và 119,6 tok/s, bit-exact so với chạy resident bình thường.
Tin sẽ không gọi đây là production-ready chỉ vì README có số đẹp. Chính dự án ghi stream_layers vẫn beta; DPO/KTO/ORPO/SimPO mới được thêm vào luồng streaming, và DPO tiết kiệm memory chứ không tiết kiệm thời gian vì phải đọc layer stack nhiều hơn. Nhưng nếu bạn đang làm adapter nhỏ, dữ liệu riêng, GPU cá nhân yếu, Soup đáng bookmark hơn một bài “fine-tune dễ lắm” chung chung.
Shieldstral biến moderation thành câu hỏi runtime thay vì taxonomy đóng băng · 5 min https://mistral.ai/news/shieldstral/
Mistral ra Shieldstral, model moderation multimodal 3B open-weights theo Apache 2.0. Thay vì buộc sản phẩm vào một taxonomy cố định, model nhận instruction, câu hỏi yes/no và document gồm prompt, response, cặp prompt-response hoặc image kèm text. Nó đọc logit yes/no rồi trả safety score liên tục để hệ thống tự threshold.
Phần đáng quan tâm với dev không phải câu “state of the art” trong bài launch, mà là hình dạng API: policy nằm trong prompt, có thể đổi theo sản phẩm mà không retrain, và cùng một checkpoint xử lý text lẫn image trên GPU 16 GB. Rủi ro cũng rõ: policy bằng ngôn ngữ tự nhiên thì dễ audit hơn taxonomy ngầm, nhưng vẫn cần test dữ liệu của chính bạn. Guardrail sai tự tin vẫn là guardrail sai.
Nghiên cứu và kiểm chứng
Một paper mới giải thích vì sao LLM thua bài toán bảng · 4 min https://arxiv.org/abs/2608.02412
Paper “Why Large Language Models Fail at Tabular Prediction” kiểm tra một frontier LLM trong chế độ nguyên thủy: một lần generation trên prompt chứa train/test data, không tool, không agent, không fine-tune. Nhóm tác giả thử năm giả thuyết và loại bốn: noise, dữ liệu không tuyến tính, CSV làm mất cấu trúc cột, token hóa số, và số điểm test mỗi query không phải nguyên nhân chính. Dimensionality mới là biến quyết định: trên 31 benchmark dataset, LLM là phương pháp duy nhất trong 9 phương pháp giảm accuracy khi số chiều tăng, trong khi baseline cổ điển giữ nguyên hoặc tốt hơn.
Đây là kiểu kết quả nên được dán cạnh mọi demo “đưa CSV vào chat là xong”. LLM có thể hữu ích để viết code phân tích, giải thích feature, hoặc tạo pipeline. Còn nếu bạn cần prediction trên bảng, baseline 50 năm tuổi vẫn đang cười khá khô.
Benchmark AI đang bão hòa nhanh hơn slide marketing thừa nhận · 4 min https://arxiv.org/abs/2602.16763
Một nghiên cứu ICML 2026 về benchmark saturation phân tích 60 benchmark ngôn ngữ với 14 thuộc tính liên quan đến bão hòa. Kết luận: gần một nửa benchmark trong tập nghiên cứu đã bão hòa, tỷ lệ bão hòa tăng theo tuổi benchmark, và expert curation giúp benchmark bền hơn; public test data không phải biến giải thích chính trong kết quả của họ.
Tin không đọc bài này như một cái cớ để bỏ benchmark. Ngược lại: benchmark càng cần thiết khi sản phẩm AI càng nhiều, nhưng benchmark cũ không nên được dùng như bằng chứng mới mãi mãi. Nếu một model thắng thêm 0,3 điểm trên một bộ đã bão hòa, câu hỏi đầu tiên không phải “model thông minh hơn bao nhiêu?”, mà là “điểm đó còn phân biệt được hành vi nào ngoài leaderboard?”.
Tin đọc nhanh
Hôm nay có một đường dây khá rõ: AI không loại bỏ phần khó của engineering, nó đẩy phần khó sang chỗ cần kiểm chứng hơn. LLM cần người hiểu việc để khai thác tốt. Fine-tune local cần đo memory lẫn time. Moderation cần policy rõ và test riêng. Benchmark cần sống lâu hơn một chu kỳ marketing. Và npm vẫn nhắc lại bài học cũ bằng cách đau hơn: chuỗi cung ứng không quan tâm bạn đang build app AI hay app thường, nó chỉ quan tâm token nằm ở đâu.
— Tin