Có gì mới
Cloudflare đang mở rộng cách khách hàng kiểm soát traffic từ AI crawler. Thay vì chỉ có một nút kiểu “block AI bots”, hệ thống mới phân loại hành vi thành ba nhóm:
- Search: crawler thu thập hoặc index nội dung để trả lời truy vấn sau này. Kỳ vọng hợp lý là site nhận referral traffic hoặc một dạng bù đắp công bằng.
- Agent: bot hoặc browser agent truy cập site thay mặt một người dùng để làm việc ngay lúc đó, ví dụ ChatGPT-User, Gemini hoặc Claude điều khiển trình duyệt.
- Training: crawler lấy nội dung để train hoặc fine-tune model, nơi dữ liệu có thể được hấp thụ lâu dài vào model.
Cloudflare cũng muốn các bot operator tách crawler theo mục đích. Nếu cùng một crawler vừa làm Search vừa lấy dữ liệu Training, chủ site rất khó biết nên cho phép hay chặn hành vi nào.
Thay đổi quan trọng
Từ ngày 15/09/2026, domain mới onboard lên Cloudflare sẽ có default mới trên các trang hiển thị quảng cáo:
- Training: bị chặn mặc định.
- Agent: bị chặn mặc định.
- Search: vẫn được cho phép mặc định.
Với crawler đa mục đích, Cloudflare sẽ áp dụng luật hạn chế nhất. Điều này có nghĩa các bot như Googlebot, Applebot hoặc BingBot, nếu được phân loại là vừa Search vừa Training, có thể bị chặn khi chủ site chọn chặn Training.
Cloudflare cũng thay đổi ý nghĩa của nhãn Verified Bot. Trước đây Verified thường đồng nghĩa với được cho phép mặc định. Cách mới tinh tế hơn: Verified chỉ làm bot “có thể được phép”, còn việc cho qua hay chặn phụ thuộc vào category mà chủ site đã cấu hình.
Content use và robots.txt
Cloudflare bổ sung khái niệm content use: bot được giữ lại và tái sử dụng nội dung đến mức nào sau khi crawl. Có ba mức:
immediate: chỉ tương tác tức thời, không lưu và không tái sử dụng.reference: index, trích đoạn và link ngược lại nguồn.full: tóm tắt và tái tạo nội dung đầy đủ.
Cloudflare đang thử signal mới use trong robots.txt, mở rộng Content Signals:
# Cloudflare Managed content with original Content Signals
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /
Phiên bản có thêm content-use signal:
# Cloudflare Managed content with the new content-use signal
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
Signal này là preference, không phải cơ chế block trực tiếp. Phần thực thi vẫn nằm ở Cloudflare Bot Management và các rule liên quan.
Cách dev nên xử lý
Nếu bạn vận hành website, docs hoặc web app có nội dung đáng crawl, đừng chỉ hỏi “AI bot có được vào không?”. Câu hỏi đúng hơn là:
- Search crawler nào cần được phép để vẫn có discoverability?
- Agent nào cần vào để phục vụ người dùng thật?
- Training crawler nào nên bị chặn hoặc chỉ được phép theo điều kiện?
- Page nào có quảng cáo, paywall, tài liệu độc quyền hoặc dữ liệu người dùng?
Với app có agent workflow, cần kiểm tra allowlist rõ ràng cho user-directed agents. Nếu không, traffic từ agent hợp lệ có thể bị nhìn giống crawler ăn cắp nội dung và bị rule chặn.