Chuyển đến nội dung
tinAI
Quay lại

Manifest bỏ LLM router: cache và độ ổn định thắng routing thông minh

manifest.build · Loại nguồn: công ty/blog 2026-07-31T20:10:02.642Z
Bản dịch tiếng Việt của tinAI · Từ Everyone is building LLM routers, we deprecated ours (manifest.build) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Everyone is building LLM routers, we deprecated ours (manifest.build)

Tác giả: Manifest

Ngày đăng: Dịch ngày:

TL;DR

Manifest từng ship LLM router cho gateway của mình, route request vào bốn tầng độ khó để giảm chi phí. Sau bốn tháng với 7.000 cloud users, họ deprecate tính năng này vì prompt ban đầu không đủ để đo độ khó, cache thường tiết kiệm hơn routing và việc đổi model làm hành vi khó dự đoán.

Ước tính đọc: 3 phút

Giới thiệu

Manifest viết thẳng: họ không còn tin vào model routing cho phần lớn use case. Công ty từng launch LLM router trong gateway vào tháng 3, deprecate vào tháng 6 và sẽ tắt hẳn ngày 1 tháng 9. Router phân loại mỗi request vào bốn tầng: simple, standard, complex và reasoning.

Mục tiêu ban đầu rất dễ hiểu: giảm chi phí inference bằng cách dùng model rẻ cho task đơn giản và model mạnh cho task khó. Sau bốn tháng vận hành trên 7.000 cloud users, Manifest thấy kết quả lẫn lộn, nhiều GitHub issue và nhiều thảo luận xoay quanh chính router.

Vì sao prompt không đủ để route

Lập luận đầu tiên của Manifest là độ khó không nằm trọn trong prompt. Prompt chỉ là điểm khởi động; phần quyết định thường xuất hiện sau khi agent gọi tool, đọc repo, search web hoặc phát hiện constraint mới.

Ví dụ evaluate the tests for the repo $GIT_REPO and improve them có thể rất đơn giản nếu repo là một website HTML cá nhân, nhưng rất nặng nếu repo là Linux kernel. Router nhìn prompt trước khi có context thật sẽ phải đoán, và đoán sai ở tầng model sẽ làm cả workflow sai hướng.

Cache rẻ hơn routing trong nhiều case

Manifest nhấn mạnh cache read rẻ hơn 75-90% so với input chưa cache. Với agent và chat dài, system prompt và conversation history thường chiếm nhiều token, mà prefix cache lại hoạt động tốt vì chúng nằm ở đầu prompt.

Một router biết cache sẽ phải stick với model ban đầu để giữ cache hiệu quả. Nói cách khác, router tốt sẽ thường chọn không route. Nếu đổi model để tiết kiệm vài cent nhưng mất cache, hóa đơn và latency có thể không đẹp hơn.

Tính nhất quán cũng là chi phí

Manifest phản đối ý tưởng rằng engineer không cần quan tâm model nào đang xử lý task. Họ cho rằng engineer nên hiểu trade-off và chọn model, effort parameter theo intent. Khi một session nhảy qua nhiều model, chất lượng tổng thể khó đoán hơn và người dùng khó học được công cụ mình đang dùng.

Với workflow agent tự động, lớp bất định này kéo theo chi phí khác: eval phức tạp hơn, prompt khó maintain hơn, observability phải giải thích thêm một quyết định ẩn, và bug report có thêm câu hỏi ‘request này bị route đi đâu?’.

Ý nghĩa với dev

LLM router không vô dụng. Nó có thể hợp lý khi task thật sự ngắn, stateless, có phân phối rõ và có eval đủ tốt cho từng tầng model. Nhưng với agent dài hơi, router không nên là phản xạ đầu tiên.

Trước khi xây router, hãy đo ba thứ: cache hit rate, độ ổn định của output khi giữ cùng model, và chi phí debug khi routing sai. Nếu cache đã kéo phần lớn chi phí xuống, lựa chọn thực dụng có thể là một model đã được team hiểu rõ, cộng với prompt và eval tốt hơn.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Everyone is building LLM routers, we deprecated ours (manifest.build) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1