Giới thiệu
Anthropic mô tả kế hoạch đánh dấu nội dung do Claude tạo ra để đáp ứng EU AI Act Article 50(2) Code of Practice on Transparency of AI-Generated Content. Các model Claude mới ra mắt tại EU từ ngày 2/8/2026 sẽ hỗ trợ machine-readable marking ngay khi launch.
Mục tiêu là để người dùng và bên thứ ba có thêm tín hiệu về nguồn gốc nội dung. Anthropic nói marking sẽ áp dụng trên các surface được hỗ trợ của Claude, gồm Claude Platform API, Claude, Claude Code, Claude Cowork và Claude Tag. Với cloud partners như AWS, Google Cloud và Microsoft Foundry, embedded text watermark sẽ áp dụng khi model được hỗ trợ, còn signed provenance metadata có thể phụ thuộc vào platform.
Cách đánh dấu
Claude dùng hai cơ chế bổ sung cho nhau.
-
Embedded watermark trong text. Khi model được hỗ trợ sinh text, watermark được nhúng trực tiếp vào text ở mức model. Người đọc không thấy watermark và nội dung không đổi nghĩa theo mô tả của Anthropic. Vì watermark nằm trong text, nó có thể đi theo khi copy-paste và có thể tồn tại qua một số chỉnh sửa.
-
Signed provenance metadata cho file. Với một số file được hỗ trợ như svg, png hoặc jpg, Claude sẽ gắn metadata có chữ ký theo chuẩn C2PA. Nếu nhãn metadata còn nguyên, nó cho biết file đã được Claude xử lý và có thể giúp phát hiện file bị sửa sau đó.
Anthropic cũng nói sẽ hỗ trợ người dùng và bên thứ ba detect các mark này, với tài liệu kỹ thuật chi tiết hơn được công bố sau.
Giới hạn cần nhớ
Detection không phải bằng chứng tuyệt đối. Bài viết nêu rõ rằng nội dung Claude tạo ra có thể không có mark nếu dùng model cũ, nếu platform hoặc feature chưa hỗ trợ, hoặc nếu nội dung bị chỉnh sửa đủ nhiều. Với file, metadata có thể mất khi convert format, re-save, screenshot hoặc qua các pipeline xử lý khác.
Ngược lại, một kết quả positive cũng chỉ nên được hiểu là nội dung có thể đã được Claude xử lý. Nó không tự trả lời các câu hỏi quan trọng hơn: ai dùng, dùng trong bối cảnh nào, nội dung đã bị sửa chưa, và policy của tổ chức cho phép gì.
Dev nên quan tâm vì…
Nếu bạn tích hợp Claude vào sản phẩm, đây là phần liên quan đến compliance và UX. Bạn cần quyết định khi nào hiển thị provenance, khi nào giữ metadata, khi nào strip metadata theo yêu cầu người dùng, và detection result được đưa vào workflow nào.
Các nguyên tắc an toàn hơn:
- Treat mark như một signal, không phải verdict.
- Đừng dùng detection một mình để kết luận gian lận, đạo văn hoặc vi phạm policy.
- Nếu sản phẩm export file, hãy hiểu rõ bước nào giữ hoặc mất C2PA metadata.
- Nếu sản phẩm chỉnh sửa text, hãy giả định watermark có thể yếu đi.
- Viết tài liệu cho người dùng về ý nghĩa và giới hạn của detection.
Điểm tích cực là Anthropic đang đưa provenance vào model và file pipeline, thay vì chỉ nói người dùng tự disclose. Điểm cần thận trọng là mọi hệ thống detection đều có lỗi, và lỗi đó thường gây hại nhất khi tổ chức biến tín hiệu kỹ thuật thành phán quyết nhân sự.