Tóm tắt
Vincent Schmalbach phát hiện TIME trả về hai phiên bản khác nhau của cùng một URL: người đọc và Googlebot nhận HTML đầy đủ, còn một số crawler AI nhận markdown gọn hơn nhiều. Một số trang markdown dành cho bot còn chứa sponsored FAQ và header Mobian để ghi nhận impression/token.
Phát hiện chính
Tác giả thử một bài TIME bằng cách đổi User-Agent. Chrome, Safari và Googlebot nhận HTML khoảng 303 KB. ClaudeBot, PerplexityBot và OAI-SearchBot nhận markdown khoảng 13.409 byte. GPTBot và ChatGPT-User bị trả 406, nên đây không phải chính sách “bot nào cũng như nhau”.
Bản markdown có các header như content-type: text/markdown, cache-control: no-store, x-mobian-impression, x-mobian-tokens và marker mobian-agent-page. Theo bài viết, x-mobian-impression thay đổi sau mỗi request, nghĩa là mỗi lần bot đọc có thể được tính như một impression riêng.
Trên một trang collection, tác giả thấy sponsored FAQ cho Ally Bank nằm trong markdown dành cho bot, kèm tracking link và JSON-LD, nhưng không xuất hiện trong HTML dành cho người đọc. Nội dung được gắn nhãn sponsored, vấn đề nằm ở chỗ người đọc bình thường không thấy lớp nội dung mà bot nhận.
Ý nghĩa với Dev
Dev nên quan tâm vì retrieval từ web không còn chỉ là “lấy URL này”. Với bot-facing content, cùng một URL có thể cho ra HTML, markdown, bị chặn, hoặc chứa nội dung sponsored tùy identity của crawler. Nếu sản phẩm của bạn dựa vào assistant search, browser automation hoặc corpus lấy từ web, hãy lưu lại User-Agent, thời điểm fetch, response headers và bản nội dung thực tế.
Đây cũng là một cảnh báo về attribution. Khi model trả lời dựa trên “TIME nói…”, câu hỏi đúng là TIME phiên bản nào: bản human thấy, bản Googlebot thấy, hay bản assistant crawler thấy?