Tin nổi bật
Qwen3.8-Max: model Max-scale mở weights, nhưng đừng đọc như brochure · 8 phút https://qwen.ai/blog?id=qwen3.8
Qwen3.8-Max là tin lớn trong ngày vì Alibaba nói đây là model mạnh nhất của họ, 2.4T parameters với 95B active, đã dùng được qua QwenCloud và sẽ mở weights trên Hugging Face/ModelScope vào tuần sau. Bản release cũng nói thẳng vào thứ dev quan tâm: OpenAI-compatible API, Anthropic-compatible API, context window 1,000,000 token, reasoning_effort để đổi độ sâu suy luận lấy chi phí, và các cấu hình mẫu cho Claude Code/Codex-style workflow.
Phần tôi tin vừa đủ là hướng đi: model frontier đang được đóng gói như worker dài hơi chứ không chỉ chatbot trả lời nhanh. Qwen đưa ra các case tự chạy nhiều ngày: repo oh-my-cli có 265 commits, 127 PRs và 151 issues sau khoảng 16 ngày; một bài toán data-selection được model tái lập rồi cải thiện trên AIME24 thêm 2.7 điểm; một cuộc thi multimodal intent recognition có 526 đội người, model đạt 0.853 accuracy sau 45 submissions và vượt 458 đội. Nhưng đây vẫn là vendor evidence. Thread HN hơn 500 comment cũng không chỉ reo mừng: nhiều người hỏi release hôm nay khác gì preview tháng 7, khi nào weights thật sự có, và economics của model local/API có đáng đổi không. Dev nên đọc bài này, nhưng đọc bằng hai mắt: một mắt nhìn API thực dụng, một mắt nhìn benchmark tự công bố.
Models & Tools
SQLite bị dính CVE rác do LLM: lỗi không nằm trong SQLite · 7 phút https://research.jfrog.com/post/sqlite-critical-cves-or-llm-slops/
JFrog kiểm tra một loạt advisory về SQLite từ một repo GitHub mới và kết luận phần lớn là slop: function được viện dẫn không tồn tại trong version bị cáo buộc, line number trỏ vào comment hoặc vượt EOF, PoC không crash, patch được nói tới không có trong diff, và trang CVE chính thức của SQLite không ghi nhận các lỗi đó. Audit rộng hơn của họ nói 54/55 advisory từ tài khoản này là bịa, một advisory còn lại có bug thật nhưng bị bọc trong metadata CVE chưa kiểm chứng.
Điểm đáng sợ không phải một người dùng LLM viết nhảm. Điểm đáng sợ là NVD/GHSA/downstream scanners có thể biến văn bản nghe có vẻ security thành ticket Critical trong backlog của doanh nghiệp. HN thread xoáy đúng vào signal-to-noise: nếu policy buộc vá mọi CVE mới, LLM slop không cần exploit production cũng đủ gây thiệt hại bằng thời gian triage.
AirLLM làm model khổng lồ vừa VRAM nhỏ, nhưng throughput mới là hóa đơn thật · 5 phút https://github.com/lyogavin/airllm
AirLLM nói nó chỉ giữ một layer trên GPU tại một thời điểm, nên có thể chạy model 70B trên GPU 4GB, Llama 3.1 405B trên 8GB, DeepSeek-V3 671B khoảng 12GB, và Kimi K3 2.8T ở 3.72GB VRAM trên RTX 6000 Ada nhờ stream expert của sparse MoE. Với dev thích thử open weights, đây là mảnh ghép đáng lưu: API nhìn vẫn là AutoModel.from_pretrained(...) và dự án hỗ trợ Qwen, DeepSeek, Llama, Mistral, Phi, Gemma.
Tôi sẽ không gọi đây là lời khuyên production. Chính thread HN hỏi câu quan trọng: nếu model phải stream từ disk, tốc độ token có đủ dùng không? Một comment còn chỉ ra số đo Kimi K3 khoảng 292 giây/token trong release note. Nói cách khác, memory trick mở cửa lab, chưa tự động mở cửa sản phẩm.
Nightcrawler nhét agent pentest local vào điện thoại · 5 phút https://github.com/garagehq/nightcrawler/
Nightcrawler là một agent pentest chạy trên smartphone, dùng LFM2.5-1.2B local trên GPU Adreno/OpenCL để chọn host, tool và bước tiếp theo, không cần cloud. README mô tả OnePlus 8 + Kali NetHunter, scope proxy chặn command ngoài phạm vi, Kali MCP server chạy nmap/curl/smbclient, dashboard web, SQLite DB, 27 exploit playbooks và database 24,956 CVE. Tác giả cũng ghi rõ tool chỉ dành cho pentest có permission.
Tin này đáng đọc vì nó làm rõ một lớp sản phẩm mới: agent AI không chỉ nằm trong IDE hay SaaS, mà bắt đầu được đóng vào thiết bị rẻ, offline, chạy nhiều giờ trong môi trường vật lý. Tôi không có bằng chứng độc lập rằng mọi claim vận hành đều ổn; giá trị của bài là architecture và threat model, không phải lời mời mang điện thoại đi thử bừa trên mạng nhà hàng xóm.
Research & Judgment
OpenAI nói model nội bộ tạo 10 tiến bộ toán/TCS, và điểm nóng là attribution · 6 phút https://openai.com/index/ten-advances-in-mathematics/
OpenAI công bố 10 kết quả từ một bản nội bộ của Astra, trải từ sphere packing, coding theory, non-sofic groups, Connes’s rigidity conjecture, arithmetic circuit complexity, quantum games, closest vector problem, Ehrhart’s volume conjecture, Ramsey numbers tới extremal graph theory. Họ nói chi phí token để tìm lời giải khoảng $2,000 theo Sol API rates, con người chuẩn bị manuscript cùng model, rồi formalize bằng Lean certificates trong repo openai/ten-proofs.
Tôi đọc đây như tín hiệu nghiên cứu nghiêm túc hơn là bài dành cho dev hành động ngay. HN thread cũng chia đôi: có người xem đây là mở cửa cho toán học, có người muốn minh bạch hơn về tổng số bài toán đã thử, số lần attempt, harness và compute cluster. Câu hỏi đó hợp lý. Với research agent, chỉ công bố lời giải thắng chưa đủ; cần cả denominator của những lần model không thắng.
Retype code do LLM viết: chậm hơn, nhưng giảm nợ nhận thức · 4 phút https://ankursethi.com/blog/prevent-cognitive-debt-by-manually-retyping-llm-generated-code/
Ankur Sethi mô tả workflow hơi ngược đời: để assistant đề xuất code trong chat, nhưng tự gõ từng dòng vào repo. Lý do không phải nostalgia. Tác giả muốn hiểu từng dòng, xây bản đồ không gian của codebase, phát hiện hallucination/design xấu trong lúc gõ, và chấp nhận chỉ nhanh hơn khoảng 2x thay vì chạy theo 10x.
Tôi thích bài này vì nó đặt tên cho một món nợ nhiều team đang giả vờ chưa có: cognitive debt. HN phản ứng mạnh vì trade-off thật sự khó. Công ty muốn throughput; developer muốn còn hiểu hệ thống sau khi robot mở PR. Cách của Sethi không phải quy trình chuẩn cho mọi đội, nhưng là lời nhắc là review diff do AI tạo không giống hiểu code do mình sở hữu.
Tin kết luận
Hôm nay có một đường nối khá rõ: model ngày càng làm được việc dài hơn, rẻ hơn, local hơn, và cũng làm bẩn pipeline nhiều hơn. Qwen bán tương lai agent nhiều ngày. AirLLM và Nightcrawler kéo AI xuống phần cứng nhỏ. OpenAI kéo nó vào toán học. SQLite CVE slop nhắc rằng cùng năng lực tạo văn bản đó có thể làm hỏng hệ thống tin cậy ngoài đời. Còn bài retype code là phản ứng rất người: nếu tốc độ tăng mà hiểu biết giảm, ai đó sẽ trả lãi.
— Tin