Chuyển đến nội dung
tinAI
Quay lại

Castform và Neon: post-train model nhỏ cho agentic retrieval

neon.com · Loại nguồn: công ty/blog 2026-08-06T20:08:56.756Z
Bản dịch tiếng Việt của tinAI · Từ How Castform + Neon Beats Frontier Models on Price and Efficiency (neon.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: How Castform + Neon Beats Frontier Models on Price and Efficiency (neon.com)

Tác giả: Neon

Ngày đăng: Dịch ngày:

TL;DR

Neon và Castform trình bày pipeline RL post-training để model nhỏ học cách tìm kiếm trên corpus riêng bằng Lakebase Search. Hướng này có thể giảm chi phí agentic retrieval, nhưng chỉ đáng tin khi có ground truth, reward và eval đủ tốt cho dữ liệu thật.

Ước tính đọc: 3 phút

Tóm tắt

Neon và Castform mô tả cách dùng dữ liệu trong Postgres/Neon Lakebase Search để post-train model nhỏ cho agentic retrieval. Thay vì gọi frontier model ở mỗi vòng tìm kiếm, pipeline tạo task từ corpus, cho model dùng search tool trong rollout, rồi chấm bằng reward function dựa trên đáp án và citation. Ý tưởng hấp dẫn là giảm chi phí retrieval nhiều bước, nhưng chất lượng phụ thuộc mạnh vào dữ liệu, ground truth và cách chấm.

Bối cảnh: từ RAG một lượt sang agentic retrieval

Bài viết phân biệt hai giai đoạn. Giai đoạn RAG truyền thống thường là một lượt embedding search: người dùng hỏi, hệ thống tìm chunk gần nhất, rồi model trả lời. Với agentic retrieval, model phải chia vấn đề thành nhiều bước, tìm kiếm nhiều lần, và tự quyết định query tiếp theo.

Vấn đề là mỗi vòng lặp thường gọi model mạnh, làm tăng latency và chi phí. Bài viết đưa ví dụ một request multi-turn search với GPT-5.6 Sol mất hơn 10 giây và khoảng 0,03 USD end-to-end. Model open-weights nhỏ rẻ hơn nhiều, nhưng không đủ tốt nếu chỉ dùng out-of-the-box.

Castform làm gì

Castform dùng RL post-training để dạy model nhỏ cách dùng search tool trên corpus cụ thể. Pipeline được mô tả theo các bước:

Điểm mạnh của cách này là task huấn luyện giống môi trường chạy thật hơn so với chỉ fine-tune trên cặp hỏi đáp tĩnh.

Điều kiện để mô hình này đáng tin

Bài viết đúng khi nói nhiều công ty có dữ liệu tốt đang nằm trong database, wiki, ticket support và tài liệu nội bộ. Nhưng dữ liệu nội bộ không tự động trở thành reward function tốt. Dev cần trả lời vài câu hỏi trước khi coi pipeline này là production-ready:

Dev nên quan tâm vì sao

Nếu sản phẩm của bạn chỉ cần tìm kiếm một lượt trên tài liệu nhỏ, cách này có thể quá nặng. Nhưng nếu agent đang chạy nhiều vòng search trên dữ liệu riêng, mỗi vòng gọi model đắt, thì post-training model nhỏ theo nhiệm vụ hẹp là hướng đáng thử nghiệm.

Bài học thực dụng là retrieval không còn chỉ là chọn vector DB. Hệ thống tốt cần dữ liệu có cấu trúc, tool search ổn định, task đại diện, reward rõ, và eval riêng cho corpus của bạn. Nếu thiếu các phần đó, đổi sang model nhỏ hơn chỉ chuyển chi phí thành lỗi khó thấy hơn.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ How Castform + Neon Beats Frontier Models on Price and Efficiency (neon.com) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: công ty/blog 2