Tin nổi bật
18 model nhỏ của Desert Ant: giá trị nằm ở đường đưa vào app, không phải nhãn “frontier”
https://desertant.com/blog/introducing-desert-ant-labs/
Desert Ant Labs phát hành 18 model chuyên biệt — 12 bản stable, sáu beta — qua một SDK cho Swift, Kotlin và JavaScript, miễn phí tới 100.000 thiết bị hoạt động mỗi tháng. Những con số đáng thử nằm ở tác vụ hẹp: Redact 12 MB bắt 88,8% dữ liệu cá nhân, gần mức 91,1% của GLiNER-PII 2,3 GB; hãng còn nói Voz chép 10 phút audio trong hai giây trên iPhone. Nhưng sipjca chỉ ra Voz thực chất là Parakeet v3 với inference code riêng cho macOS/iOS, còn library8848 nhận ra nhiều model nền đã có sẵn. Mình không xem đó là điểm loại: đóng gói model, runtime và SDK thành feature chạy được vẫn là engineering có giá trị. Nó chỉ có nghĩa benchmark của hãng chưa chứng minh một bước nhảy về model. Làm ngay. Chọn một luồng lặp lại, nhạy cảm dữ liệu, benchmark trên đúng device matrix và đọc kỹ license trước khi thay cloud API.
Agent vào phòng lab: verifier quan trọng hơn hào quang quantum
Codex điều phối calibration trên chip sáu qubit. OpenAI mô tả agent chọn tham số, chạy phép đo, phân tích rồi tinh chỉnh khi tín hiệu rõ; tín hiệu nhiễu vẫn cần researcher. throwaway63467 nhắc automation này đã có bằng Python từ 2011. Mình thấy bước tiến nằm ở vòng lặp thích nghi, không phải “AI làm quantum”; hãy giữ expert ở ranh giới dữ liệu mơ hồ.
Prefill reasoning cho thấy dấu vết, chưa chứng minh nguồn gốc
Qwen3.8 đổi mạnh khi nhận 1% reasoning của GPT-5.5 Pro. Thử nghiệm 45 bài đưa overlap 100 token đầu từ 16,79% lên 34,97%, tăng 18,18 điểm phần trăm. jari_mustonen hỏi đúng: độ gần tăng chưa tự chứng minh training provenance. Mình sẽ đọc đây như phép dò đáng lặp lại với control và sample lớn hơn, không phải cáo buộc đã khép hồ sơ.
Điểm chung: capability chỉ đáng tin khi lớp tích hợp, phép đo và ranh giới bàn giao cho con người đều nhìn thấy được.
— Tin