Tin nổi bật
GLM-5.3: post-training biến cùng một nền model thành một agent khác hẳn
https://huggingface.co/zai-org/GLM-5.3
GLM-5.3 giữ nguyên base model của GLM-5.2; toàn bộ bước nhảy đến từ post-training. Z.ai báo cáo điểm Terminal Bench 3.0 tăng từ 4,6 lên 28,3, DeepSWE từ 46,2 lên 66,9 và CyberGym đạt 84,5. Model được phát hành open-weight, với hỗ trợ từ vLLM, SGLang và Transformers. Mình thấy đáng hành động không phải vì một bảng benchmark dài, mà vì cùng một nền đã mạnh hơn rõ rệt ở coding dài hơi và cyber. Dù vậy, đây vẫn là số liệu do nhà phát hành công bố; vài bài chạy dùng context rất lớn và ngân sách thời gian tới 6–10 giờ. scosman trên HN nhận xét trải nghiệm “feels like Opus 4.8”, nhưng đó là lý do để thử, chưa phải bằng chứng thay cho eval của team bạn. Nếu hạ tầng đủ sức phục vụ model, hãy chạy một bộ eval trên repo thật với ngân sách cố định rồi so chi phí, latency và tỷ lệ hoàn tất trước khi đổi.
Hai thay đổi dev nên kiểm tra
OpenAI Python SDK chuyển sang HTTPX2. SDK giờ cài HTTPX2, không còn kéo httpx hay certifi. API mặc định giữ nguyên, nhưng trust store chuyển sang CA của hệ điều hành; mình sẽ kiểm tra container tối giản, proxy TLS doanh nghiệp và test dùng RESPX trước khi nâng cấp. simonw xem fork này là đường ổn định khi HTTPX tiến tới 1.0. Đọc migration guide và kiểm tra CA trong image trước khi bump.
AI enforcement đẩy Luanti khỏi Google Play. Tracer.AI gửi DMCA thay Microsoft nhưng không chỉ ra asset cụ thể; một vụ tương tự năm 2023 khiến app mất 46 ngày mới trở lại. Hnrobert42 chỉ đúng động cơ lệch: false positive gần như miễn phí, false negative lại có chi phí. Mình đọc bài của Luanti như một cảnh báo vận hành về automation thiếu human review.
Cùng một ngày, post-training nâng năng lực model còn AI agent hạ app vô căn cứ: capability đang tăng nhanh hơn accountability.
— Tin