Chuyển đến nội dung
tinAI
Quay lại

18 model on-device của Desert Ant Labs: từ benchmark đến tích hợp

desertant.com · Loại nguồn: công ty/blog 2026-09-09T20:11:08.873Z
Bản dịch tiếng Việt của tinAI · Từ On-device intelligence for every product (desertant.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: On-device intelligence for every product (desertant.com)

Tác giả: Desert Ant Labs

Ngày đăng: Dịch ngày:

TL;DR

Desert Ant Labs phát hành 18 model chuyên biệt cho audio, vision và text qua SDK Swift, Kotlin và JavaScript, miễn phí tới 100.000 thiết bị hoạt động mỗi tháng. Giá trị chính là inference cục bộ có latency thấp và giữ dữ liệu trên thiết bị, nhưng benchmark của hãng cần được kiểm chứng trên device matrix thật.

Ước tính đọc: 4 phút

Giới thiệu

Desert Ant Labs ra mắt một bộ model chuyên biệt chạy trực tiếp trên thiết bị cho các tác vụ audio, vision và text. Đợt đầu có 18 model, gồm 12 bản stable và sáu bản beta, được đưa vào ứng dụng qua cùng một SDK cho Swift, Kotlin và JavaScript.

Mục tiêu của bộ công cụ là thay những API call lặp đi lặp lại bằng inference cục bộ: không có chi phí theo token, không cần round-trip tới server và dữ liệu của người dùng không rời khỏi thiết bị. Các con số hiệu năng dưới đây là benchmark do Desert Ant Labs công bố, vì vậy dev vẫn cần đo lại trên phần cứng và dữ liệu thật của sản phẩm.

Các model đáng chú ý

Các model được miễn phí tới 100.000 thiết bị hoạt động mỗi tháng. Đây là ngưỡng license theo số thiết bị, không phải lời hứa rằng mọi workload đều miễn phí vô hạn; đội phát triển cần kiểm tra điều khoản trước khi đưa vào production.

Vì sao chọn on-device

Nhóm phát triển đã xây ứng dụng video Detail trong năm năm. Khi thêm auto-edit, audio enhancement và transcription, họ từng phải dựa vào cloud API, kéo theo chi phí hạ tầng tăng cùng lượng người dùng. Detail 6 dự kiến thay toàn bộ các API đó bằng model chạy trên thiết bị.

Lập luận kỹ thuật của họ là nhiều tác vụ không cần một frontier model đa dụng. NVIDIA từng ước tính 40–70% lời gọi model lớn trong ba agent system có thể chuyển sang model nhỏ, chuyên biệt. Với các việc như lọc dữ liệu cá nhân, gắn tag ảnh hoặc làm sạch audio, latency ổn định và quyền riêng tư đôi khi quan trọng hơn khả năng suy luận tổng quát.

Inference cục bộ cũng thay đổi kiến trúc sản phẩm. Một tính năng có thể chạy trên mọi message hoặc frame thay vì chỉ trên mẫu được chọn để tiết kiệm token. Dữ liệu nhạy cảm không cần tải lên cloud, còn ứng dụng vẫn hoạt động khi kết nối kém.

SDK và cách tích hợp

Desert Ant cung cấp SDK native cho Swift và Kotlin, SDK JavaScript, CLI trên macOS, tài liệu dành cho dev và agent, cùng bản model trên Hugging Face. Clear và Voz dùng Neural Engine trên iPhone; trong browser, Clear chạy cùng bộ weights qua WebAssembly.

Hướng triển khai mà nhóm mô tả gồm hai tầng. Tầng “cerebellum” dùng các model nhỏ cho tác vụ luôn bật; một router cục bộ sẽ quyết định khi nào cần model lớn hơn và chỉ gửi lên cloud khi công việc thực sự phải rời thiết bị.

Dev nên bắt đầu bằng một tác vụ hẹp có baseline rõ ràng. Hãy đo quality, thời gian xử lý, memory và mức tiêu thụ năng lượng trên toàn bộ device matrix; kiểm tra fallback khi model không đủ chắc chắn; sau đó mới so tổng chi phí với API hiện tại. Với dữ liệu cá nhân, cần xác nhận cả pipeline tiền xử lý lẫn log đều ở local, không chỉ riêng bước inference.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ On-device intelligence for every product (desertant.com) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: GitHub 1