Tin nổi bật
Reasoning trace mã hóa vẫn có thể rò, và agent log là nơi đau nhất · 7 phút https://stolen-thoughts.com/
Làm ngay. Đừng lưu encrypted reasoning blocks trong public logs. Nhóm nghiên cứu replay trace từ model mạnh sang model yếu cùng nhà cung cấp, jailbreak model yếu rồi khôi phục plaintext. Trên 6.708 agent trajectories công khai, họ dựng lại 315.320 reasoning blocks và tìm 704 privacy artifacts; 64 artifact chỉ nằm trong reasoning, không có trong transcript nhìn thấy.
dboreham hỏi đúng điểm dễ gây hiểu nhầm: đây có thật là phá mã không? Cơ chế được mô tả giống lỗi ràng buộc và replay xuyên model hơn là bẻ cipher. Tên gọi không làm rủi ro nhỏ đi: blob mà client giữ được là dữ liệu nhạy cảm. Team chạy coding agent nên ngừng publish trace, rà support dump và telemetry, rồi rotate secret nếu trace đã lộ.
Provenance và ranh giới tin cậy
Claude chuẩn bị watermark text và gắn C2PA cho file, nhưng detection không phải phán quyết cuối · 4 phút https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
Đọc lướt. Claude model ra mắt tại EU từ 2/8/2026 sẽ hỗ trợ machine-readable marking: text có watermark ở cấp model, còn file được hỗ trợ mang signed C2PA metadata. Con số quyết định là không có con số accuracy công khai cho detection.
dilettante_ chỉ ra rủi ro quan trọng: tài liệu hoàn toàn do người viết vẫn có thể bị false positive, trong khi metadata cũng có thể mất khi convert hoặc chụp màn hình. Đáng đọc nếu bạn làm compliance hoặc provenance; hãy dùng mark như một signal trong chuỗi bằng chứng, không phải phán quyết gian lận.
Needle 2 đặt cược rằng tool calling trên thiết bị không cần model tỉ tham số · 5 phút https://cactuscompute.com/needle
Đọc kỹ. Needle 2 nén tool-calling model 45M tham số vào binary 14 MB, dùng khoảng 28 MB RAM và được công bố đạt hơn 500 decode tokens/giây trên Raspberry Pi 5. Scope hẹp này hợp lý cho thiết bị cần chọn function và điền schema, không cần chat dài.
Demo cũng cho thấy giới hạn thật. tiberium nhập “HN” nhưng model lại chọn khóa cửa trước, dù confidence bằng 0. Đó là bằng chứng để thiết kế guardrail: ngoài miền phải trả no-call, action nguy hiểm cần confirm, và confidence thấp phải fallback. Đáng đọc nếu bạn làm on-device automation; benchmark throughput không thay thế kiểm thử safety.
llama.cpp trong macOS VM nhanh hơn 7-16 lần khi guest báo đúng capability Metal hơn · 4 phút https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Đọc kỹ. Cua báo llama.cpp trong macOS VM nhanh hơn 7–16 lần nhờ shim khiến guest chọn đúng Metal kernel; TinyLlama generation trên M1 Ultra tăng từ 12,63 lên 206,60 tokens/giây.
simonw làm rõ caveat quyết định: đây là sửa kernel selection trong Virtualization.framework VM, không phải tăng tốc llama.cpp cho mọi máy Apple Silicon. Đáng đọc nếu bạn vận hành agent farm hoặc computer-use sandbox trên Mac. Với bare metal, headline này không cho bạn thêm throughput.
Tin đọc nhanh
Google nói Go hợp với AI-assisted software engineering; thesis đúng, bằng chứng còn thiếu · 3 phút https://developers.googleblog.com/why-go-is-an-ideal-language-for-ai-assisted-software-engineering/
Bỏ qua. Google lập luận Go hợp với AI-assisted engineering nhờ gofmt, compiler nhanh, test, fuzzing và dependency controls. Checklist đó tốt, nhưng bài không đưa ra số liệu so sánh workflow LLM giữa Go và ngôn ngữ khác.
yosefk hỏi đúng phần còn thiếu: dữ liệu định lượng ở đâu, nhất là khi Go cũng có bằng chứng về concurrency bugs? Đừng đổi stack vì bài này. Nếu team đã dùng Go, hãy mượn checklist để siết formatter, test và dependency policy; còn quyết định ngôn ngữ nên dựa trên năng lực review và lỗi production của chính team.
Hôm nay mình chọn security trước capability: trace, provenance và tool call đều cần boundary có thể kiểm chứng. Tốc độ model chỉ đáng kể sau khi log và action không còn là attack surface.
— Tin