Tóm tắt
Neon và Castform mô tả cách dùng dữ liệu trong Postgres/Neon Lakebase Search để post-train model nhỏ cho agentic retrieval. Thay vì gọi frontier model ở mỗi vòng tìm kiếm, pipeline tạo task từ corpus, cho model dùng search tool trong rollout, rồi chấm bằng reward function dựa trên đáp án và citation. Ý tưởng hấp dẫn là giảm chi phí retrieval nhiều bước, nhưng chất lượng phụ thuộc mạnh vào dữ liệu, ground truth và cách chấm.
Bối cảnh: từ RAG một lượt sang agentic retrieval
Bài viết phân biệt hai giai đoạn. Giai đoạn RAG truyền thống thường là một lượt embedding search: người dùng hỏi, hệ thống tìm chunk gần nhất, rồi model trả lời. Với agentic retrieval, model phải chia vấn đề thành nhiều bước, tìm kiếm nhiều lần, và tự quyết định query tiếp theo.
Vấn đề là mỗi vòng lặp thường gọi model mạnh, làm tăng latency và chi phí. Bài viết đưa ví dụ một request multi-turn search với GPT-5.6 Sol mất hơn 10 giây và khoảng 0,03 USD end-to-end. Model open-weights nhỏ rẻ hơn nhiều, nhưng không đủ tốt nếu chỉ dùng out-of-the-box.
Castform làm gì
Castform dùng RL post-training để dạy model nhỏ cách dùng search tool trên corpus cụ thể. Pipeline được mô tả theo các bước:
- Dữ liệu thô nằm trong Postgres trên Neon.
- Lakebase Search cung cấp text search và vector search.
- Castform tạo câu hỏi, ground truth và task từ dữ liệu sẵn có.
- Trong rollout, model gọi search tool để tìm thông tin.
- Reward function chấm trace theo việc model tìm đúng nguồn, cite đúng và trả lời đúng.
- Model đã train dùng cùng search tool khi chạy production inference.
Điểm mạnh của cách này là task huấn luyện giống môi trường chạy thật hơn so với chỉ fine-tune trên cặp hỏi đáp tĩnh.
Điều kiện để mô hình này đáng tin
Bài viết đúng khi nói nhiều công ty có dữ liệu tốt đang nằm trong database, wiki, ticket support và tài liệu nội bộ. Nhưng dữ liệu nội bộ không tự động trở thành reward function tốt. Dev cần trả lời vài câu hỏi trước khi coi pipeline này là production-ready:
- Corpus có nhiều thông tin cũ, sai, hoặc mâu thuẫn không?
- Ground truth sinh tự động có được audit bằng mẫu thủ công không?
- Benchmark có kiểm tra multi-hop retrieval, không chỉ câu hỏi tìm một đoạn rõ ràng không?
- Reward có phạt câu trả lời đúng nhưng cite sai nguồn không?
- Chi phí train và vận hành nhỏ hơn chi phí gọi frontier model trong traffic thật không?
Dev nên quan tâm vì sao
Nếu sản phẩm của bạn chỉ cần tìm kiếm một lượt trên tài liệu nhỏ, cách này có thể quá nặng. Nhưng nếu agent đang chạy nhiều vòng search trên dữ liệu riêng, mỗi vòng gọi model đắt, thì post-training model nhỏ theo nhiệm vụ hẹp là hướng đáng thử nghiệm.
Bài học thực dụng là retrieval không còn chỉ là chọn vector DB. Hệ thống tốt cần dữ liệu có cấu trúc, tool search ổn định, task đại diện, reward rõ, và eval riêng cho corpus của bạn. Nếu thiếu các phần đó, đổi sang model nhỏ hơn chỉ chuyển chi phí thành lỗi khó thấy hơn.