Anthropic vừa đăng bài viết trên blog nhằm giải đáp những thắc mắc xoay quanh kế hoạch gắn watermark vào văn bản do chatbot Claude tạo ra. Động thái này được đưa ra trong bối cảnh công ty chuẩn bị tuân thủ Bộ quy tắc minh bạch thuộc Đạo luật AI của Liên minh châu Âu (EU AI Act), yêu cầu các công ty AI xây dựng hệ thống giúp nhận diện nội dung do AI tạo ra.
Theo Anthropic, watermark sẽ được tạo ra thông qua những lựa chọn nhỏ trong quá trình Claude tạo văn bản. Chẳng hạn, khi mô tả thời tiết, mô hình có thể lựa chọn giữa những từ có ý nghĩa tương đương. Từ đó, Claude tạo ra một mẫu đặc biệt không thể nhận biết bằng mắt thường nhưng có thể được phát hiện bởi những người sở hữu khóa tương ứng.
Công ty khẳng định watermark không làm thay đổi chất lượng nội dung. Với người đọc, văn bản có watermark sẽ không có sự khác biệt rõ rệt so với nội dung không được gắn dấu nhận diện.
Về công nghệ, Anthropic cho biết Claude sẽ sử dụng phương pháp SynthID Text do nhóm Google DeepMind giới thiệu năm 2024. Công ty cũng có kế hoạch phát hành API chuyên dụng để phát hiện watermark trong nội dung do Claude tạo ra.
Anthropic đồng thời phân biệt công nghệ này với các công cụ phát hiện AI dựa trên đặc điểm văn phong. Những hệ thống như vậy thường tìm kiếm các cách diễn đạt hoặc cấu trúc câu được cho là dấu hiệu của nội dung do AI tạo ra. Trong khi đó, watermark hoạt động dựa trên một mẫu được cài trực tiếp trong quá trình tạo văn bản.
Một vấn đề được người dùng quan tâm là liệu watermark có thể bị xóa bằng cách chỉnh sửa nội dung hay không. Anthropic cho biết việc chỉnh sửa nhẹ nhiều khả năng không thể xóa hoàn toàn watermark, trong khi viết lại toàn bộ văn bản và thay thế mọi từ có thể loại bỏ dấu nhận diện này.
Đối với nội dung chỉ được Claude kiểm tra hoặc chỉnh sửa nhẹ, khả năng phát hiện watermark sẽ phụ thuộc vào độ dài văn bản cũng như mức độ chỉnh sửa. Nếu phần lớn nội dung vẫn do con người viết, sẽ có rất ít yếu tố do Claude tạo ra để watermark bám vào.
Với mã nguồn, watermark dự kiến ít rõ rệt hơn do mô hình phải tạo ra code có khả năng hoạt động và không có nhiều lựa chọn tương đương giữa các phương án. Tuy nhiên, watermark vẫn có thể xuất hiện ở những phần mang tính tùy chọn, chẳng hạn như chú thích trong code, nhưng Anthropic cho rằng ảnh hưởng đến mã nguồn thực tế sẽ không đáng kể.
Đáng chú ý, Anthropic cho biết Claude sẽ không phải chatbot AI duy nhất áp dụng công nghệ này. Theo công ty, nhiều nhà phát triển mô hình AI lớn khác cũng đã ký Bộ quy tắc thực hành tương tự và sẽ triển khai hệ thống watermark riêng. Điều này cho thấy watermark đang được xem là một trong những phương án quan trọng để tăng khả năng minh bạch và nhận diện nội dung AI trong thời gian tới.