Tin nổi bật
GLM-5.3 ép câu hỏi open-weight coding model thành câu hỏi vận hành · 5 phút https://z.ai/blog/glm-5.3
Làm ngay. Z.ai phát hành GLM-5.3 với cùng base model như GLM-5.2; phần tăng đến từ post-training trên môi trường coding và agent dài hơi. Các số đáng nhìn: Terminal-Bench 3.0 tăng từ 4,6 lên 28,3, DeepSWE v1.1 từ 46,2 lên 66,9, CyberGym đạt 84,5%, còn ExploitBench hơn gấp đôi từ 24,4 lên 54,4. Thay đổi API cũng thực dụng: thinking.type: “disabled” không còn được hỗ trợ, nên app phải bật thinking và chọn reasoning_effort trước khi đổi model ID.
Caveat: đây vẫn là benchmark và ledger do vendor công bố. Z.ai nói weights sẽ mở sau hai tuần để đánh giá an toàn, đồng thời ghi 2.436 phát hiện bảo mật, 2.383 còn dưới embargo. Trên HN, newyankee nói cơn lũ release làm việc chọn model rất khó, còn z4y5f3 kéo sự chú ý về ledger CVE. Đáng đọc nếu bạn route coding agent; đừng đổi default trước khi có eval nội bộ và policy cho cyber capability.
Tool và workflow
ThoughtDAG cho thấy context cần được edit như dữ liệu, không chỉ cuộn lại trong chat · 3 phút https://chenxiachan.github.io/thoughtdag/
Đọc lướt. ThoughtDAG là một app graph cho hội thoại LLM: node và edge quyết định phần nào đi vào request tiếp theo. Demo quan trọng không phải UI đẹp mà là cơ chế kiểm chứng: preview cho biết model sẽ nhận source nào, thứ tự nào, bao nhiêu token; xóa một edge thì nhánh đó thật sự rời context và cùng prompt cho kết quả khác.
Điểm trừ là nó đang đứng riêng như một app. Tác giả chatchan nói dự án MIT, local-first, hỗ trợ Ollama và endpoint OpenAI-compatible, có PDF clipping kèm page provenance. Nhưng esperent hỏi đúng: nhiều dev sẽ muốn đây là plugin trong editor hoặc agent tool sẵn dùng hơn. Đáng đọc nếu bạn làm nghiên cứu dài, support ticket, hay RAG prompt mà lỗi lớn nhất là context bẩn.
Yadda 3.0 nhắc rằng spec chạy được là context tốt hơn wiki cho coding agent · 4 phút http://www.stephen-cresswell.com/2026/08/15/Yadda-3.0.0-BDD-in-the-Age-of-AI-Agents.html
Đọc kỹ. Yadda 3.0 hiện đại hóa BDD library cho JavaScript: Node-only, bỏ CasperJS/PhantomJS/Bower/Component, chuyển test sang node:test, dùng Biome và lefthook, viết ES6, thêm ví dụ Playwright/Puppeteer và TypeScript definitions. Nhưng phần đáng giữ là cách tác giả dùng Claude Code Opus 4.8: chia phase rõ, không cho agent sửa production code và test cùng một bước, dựa vào test suite có sẵn làm ràng buộc ngoài.
BDD vẫn có phí: phải viết ngôn ngữ domain đủ sạch để không thành script tiếng Anh giả. jesol nói high-level API/UI tests đang buộc codebase AI phải chuẩn hóa lớp service và SDK; ur-whale nhắc acronym BDD còn cần giải thích. Đáng đọc nếu team bạn đang để agent viết feature từ issue mơ hồ.
Hype cần kiểm chứng
AI drug discovery vẫn thiếu bằng chứng lâm sàng, không thiếu press release · 4 phút https://www.science.org/content/blog-post/so-how-ai-drug-discovery-doing-really
Bỏ qua. Không phải vì bài của Derek Lowe yếu; ngược lại, bài đáng tin vì nó dập đúng chỗ hype. Điểm chính từ paper ông bàn là tác động lâm sàng của AI trong drug discovery vẫn “absence of evidence”, chưa phải “evidence of absence”. Thước đo nên nhìn là Phase II success rate, vì tiền và thời gian thật nằm ở clinical trial, không phải ligand đẹp trong assay sớm.
Phần liên quan tới dev là benchmark hygiene. Lowe cảnh báo dữ liệu assay có confounding, điều kiện thí nghiệm và nhãn rất khó chuẩn hóa; tin vào label bẩn sẽ làm benchmark bẩn. Đáng đọc nếu bạn xây ML tooling cho biology. Còn nếu bạn chỉ tìm tín hiệu cho coding agent, đây là một lời nhắc chung: domain càng đắt để kiểm chứng, câu chuyện AI càng cần bằng chứng ngoài demo.
Tin đọc nhanh
Điểm nối hôm nay là quyền kiểm soát. Model mạnh hơn cần eval và policy rõ hơn; context graph cần cho người dùng thấy request thật; spec chạy được giữ agent khỏi tự định nghĩa lại đúng sai. Mình thích ngày có nhiều release như vậy, miễn là mình còn nhìn thấy phép kiểm tra nằm ở đâu.
— Tin