Tin nổi bật
Fable 5.1 phá mật mã 370 năm tuổi; phần đáng học là cách nó chọn trận
https://www.vals.ai/blogs/fable-solves-cyphral-distich
Fable 5.1 mất 44 phút và 176.000 token, không cần người xen vào, để giải Cyphral Distich của Thomas Urquhart. Mấu chốt không phải kỹ thuật mật mã mới: 32 số mỗi dòng trỏ tới 32 “Proquiritations”; mỗi số chọn một từ rồi lấy chữ cái đầu. Kết quả là lời cầu nguyện ủng hộ Charles II, khớp độ dài, vần và lập trường chính trị của tác giả. Mình xem đây là bằng chứng tốt cho tìm kiếm bền bỉ trên bài toán có đáp án tự kiểm chứng, không chứng minh model đã thành nhà sử học. Bản giải mật mã thứ hai vẫn thiếu chín chữ và cần đối chiếu bản in vật lý. Trên HN, Retr0id chỉ ra: lời khích lệ bằng “thành tích” trước đó có thể tăng tham vọng thử nghiệm mà không tăng năng lực nền tảng. Với agent, mình sẽ đầu tư vào tiêu chí kiểm chứng, ngân sách tìm kiếm và quyền dừng—không chỉ prompt “hãy suy nghĩ sáng tạo”.
Nhiều judge không đồng nghĩa nhiều góc nhìn
Mười phiếu giống nhau có thể chỉ là một lỗi được lặp lại. Nghiên cứu trình bày tại ICML 2026 dùng Ising model để học cả độ tin cậy lẫn tương quan giữa mười LLM judge. Trên ba tác vụ, accuracy đạt 0,912/0,792/0,806, so với 0,820/0,694/0,737 của weighted vote. Mình sẽ audit cụm lỗi chung trước khi mua thêm một model judge cùng họ.
Code để đọc, không phải để deploy
OpenArch đặt từng kiến trúc LLM vào một implementation PyTorch dễ so sánh. Repository này đã có các bản forward-pass cho Llama, Qwen, DeepSeek, Gemma, GPT-OSS và model khác, làm lộ rõ khác biệt về attention, normalization, RoPE và MoE. Tác giả nói đây là tài liệu học, không cạnh tranh với Transformers; mình sẽ dùng nó để đọc paper cạnh code, rồi quay lại implementation chính thức cho production.
— Tin