Giới thiệu
Một agent tốt cần hai thứ cùng lúc: có cách tìm đúng dữ liệu và có model biết khi nào cần tìm tiếp. Neon đặt phần dữ liệu trong Postgres/Lakebase Search; Castform đặt phần model trong một vòng RL post-training cho tác vụ retrieval.
Bài viết mô tả lý do RAG một lượt không còn đủ khi agent phải chia câu hỏi lớn thành nhiều lượt search. Mỗi lượt gọi frontier model làm latency và chi phí tăng; ví dụ của Neon nói một request multi-turn với GPT-5.6 Sol mất hơn 10 giây và khoảng 0,03 USD end-to-end. Model open-weights nhỏ rẻ hơn nhiều, nhưng cần huấn luyện vào đúng hành vi search.
Cách pipeline hoạt động
Pipeline của Castform/Neon có vài mảnh chính:
- Corpus gốc nằm trong Postgres trên Neon.
- Lakebase Search cung cấp cả tìm kiếm text và vector.
- Castform tạo task huấn luyện từ dữ liệu sẵn có, ví dụ biến một policy nội bộ thành câu hỏi và đáp án chuẩn.
- Agent chạy rollout, gọi tool search, rồi được chấm bằng reward function cho retrieval, citation và correctness.
- Model sau huấn luyện dùng cùng tool search trong inference, thay vì chỉ học thuộc dữ liệu.
Điểm quan trọng là reward function phải đo đúng việc bạn cần. Nếu reward chỉ thưởng câu trả lời nghe hợp lý, model có thể học cách qua mặt bài test. Bài viết cũng nhắc phần observability: xem reward tăng, mở từng task/prompt để tìm broken tools hoặc reward hacking.
Ý nghĩa với Dev
Dev nên quan tâm vì đây là một hướng thực tế hơn “hãy nhét thêm context vào prompt”. Nếu một tác vụ retrieval lặp lại đủ nhiều, bạn có thể huấn luyện model nhỏ cho đúng tool và đúng corpus thay vì dùng model lớn cho mọi lượt search.
Nhưng bài này vẫn là case của vendor. Trước khi tin lời “rẻ hơn 100x”, hãy chạy eval trên dữ liệu của chính bạn: câu hỏi dễ và khó, nguồn cũ/sai, citation bắt buộc, needle trong corpus lớn, và trường hợp cần nhiều bước mới tìm ra đáp án. Retrieval rẻ chỉ có ý nghĩa khi nó vẫn tìm đúng.