Giới thiệu
Desert Ant Labs ra mắt một bộ model chuyên biệt chạy trực tiếp trên thiết bị cho các tác vụ audio, vision và text. Đợt đầu có 18 model, gồm 12 bản stable và sáu bản beta, được đưa vào ứng dụng qua cùng một SDK cho Swift, Kotlin và JavaScript.
Mục tiêu của bộ công cụ là thay những API call lặp đi lặp lại bằng inference cục bộ: không có chi phí theo token, không cần round-trip tới server và dữ liệu của người dùng không rời khỏi thiết bị. Các con số hiệu năng dưới đây là benchmark do Desert Ant Labs công bố, vì vậy dev vẫn cần đo lại trên phần cứng và dữ liệu thật của sản phẩm.
Các model đáng chú ý
- Voz xử lý speech-to-text, trả timestamp cho từng từ. Hãng cho biết model có thể chép 10 phút audio trong hai giây trên iPhone và nhanh hơn Whisper 4,7 lần.
- Clear là model 9 MB để khử nhiễu và cải thiện audio. Theo benchmark của hãng, năm phút bản ghi được xử lý trong một giây.
- Redact phát hiện và che tên, địa chỉ cùng số thẻ theo thời gian thực ở 27 ngôn ngữ. Model 12 MB đạt tỷ lệ phát hiện 88,8%, so với 91,1% của GLiNER-PII 2,3 GB trong phép đo của Desert Ant.
- Tongue nhận diện 84 ngôn ngữ từ ba từ đầu vào. Model 2 MB đạt accuracy 0,933, cao hơn mức 0,887 của một detector 293 MB trong benchmark được công bố.
- Clips biến video 10 phút thành một nhóm clip ngắn. Desert Ant nói model 284 MB hoàn thành trong năm giây, nhanh hơn 10 lần và dùng ít năng lượng hơn 470 lần so với Claude Sonnet ở workflow của ứng dụng Detail.
Các model được miễn phí tới 100.000 thiết bị hoạt động mỗi tháng. Đây là ngưỡng license theo số thiết bị, không phải lời hứa rằng mọi workload đều miễn phí vô hạn; đội phát triển cần kiểm tra điều khoản trước khi đưa vào production.
Vì sao chọn on-device
Nhóm phát triển đã xây ứng dụng video Detail trong năm năm. Khi thêm auto-edit, audio enhancement và transcription, họ từng phải dựa vào cloud API, kéo theo chi phí hạ tầng tăng cùng lượng người dùng. Detail 6 dự kiến thay toàn bộ các API đó bằng model chạy trên thiết bị.
Lập luận kỹ thuật của họ là nhiều tác vụ không cần một frontier model đa dụng. NVIDIA từng ước tính 40–70% lời gọi model lớn trong ba agent system có thể chuyển sang model nhỏ, chuyên biệt. Với các việc như lọc dữ liệu cá nhân, gắn tag ảnh hoặc làm sạch audio, latency ổn định và quyền riêng tư đôi khi quan trọng hơn khả năng suy luận tổng quát.
Inference cục bộ cũng thay đổi kiến trúc sản phẩm. Một tính năng có thể chạy trên mọi message hoặc frame thay vì chỉ trên mẫu được chọn để tiết kiệm token. Dữ liệu nhạy cảm không cần tải lên cloud, còn ứng dụng vẫn hoạt động khi kết nối kém.
SDK và cách tích hợp
Desert Ant cung cấp SDK native cho Swift và Kotlin, SDK JavaScript, CLI trên macOS, tài liệu dành cho dev và agent, cùng bản model trên Hugging Face. Clear và Voz dùng Neural Engine trên iPhone; trong browser, Clear chạy cùng bộ weights qua WebAssembly.
Hướng triển khai mà nhóm mô tả gồm hai tầng. Tầng “cerebellum” dùng các model nhỏ cho tác vụ luôn bật; một router cục bộ sẽ quyết định khi nào cần model lớn hơn và chỉ gửi lên cloud khi công việc thực sự phải rời thiết bị.
Dev nên bắt đầu bằng một tác vụ hẹp có baseline rõ ràng. Hãy đo quality, thời gian xử lý, memory và mức tiêu thụ năng lượng trên toàn bộ device matrix; kiểm tra fallback khi model không đủ chắc chắn; sau đó mới so tổng chi phí với API hiện tại. Với dữ liệu cá nhân, cần xác nhận cả pipeline tiền xử lý lẫn log đều ở local, không chỉ riêng bước inference.