Anthropic офіційно анонсувала впровадження текстового водяного знака для Claude. Нововведення дозволить визначати, чи була модель залучена до створення тексту. При цьому якість відповідей не постраждає. Як повідомляє офіційний блог Anthropic, маркування впроваджується на виконання вимог Акту про штучний інтелект Європейського Союзу.

Як це працює: вибір слів як цифровий відбиток

Claude створює текст, обираючи одне слово за іншим. У багатьох випадках існує кілька однаково доречних варіантів. Наприклад, у реченні «The weather today was cold and…» слова «overcast» і «grey» однаково підходять.

Зазвичай вибір визначає випадковість. Водяний знак змінює джерело цієї випадковості. Він використовує спеціальний ключ і попередні слова для ухвалення рішення.

Це створює непомітну закономірність. Читач її не бачить. Але той, хто має ключ, може визначити ймовірність участі Claude у написанні тексту.

Якість не постраждає: що обіцяє Anthropic

Водяний знак не впливає на зміст, креативність чи читабельність. Він не додає прихованих символів і не змінює значення слів.

У внутрішніх тестах Anthropic не виявила жодного впливу на якість. Google DeepMind проводила подібні експерименти зі своєю моделлю Gemini. Користувачі не помічали різниці між маркованими та немаркованими текстами.

Водяний знак не сповільнює роботу моделі. Він не створює додаткових токенів, тому вартість використання Claude не змінюється.

Технологія SynthID-Text: що використовує Anthropic

Claude використовує метод SynthID-Text. Його опублікувала Google DeepMind у журналі Nature у 2024 році.

Цей підхід належить до сімейства методів, запропонованих Скоттом Ааронсоном у 2022 році. Усі вони ґрунтуються на одному принципі: змінюється лише джерело випадковості, а не самі слова.

Обмеження: коли водяний знак не працює

Водяний знак має свої обмеження. Він погано працює на коротких текстах — потрібно достатньо слів для виявлення закономірності.

Він слабший у фактичних твердженнях. Наприклад, у реченні «2+2=4» немає вибору — відповідь єдина. Там водяному знаку нема на що спиратися.

Майже не діє під час редагування. Якщо Claude лише виправляє граматику чи пунктуацію, більшість слів належать людині. Водяний знак може зачепити лише кілька виправлень — цього замало для впевненого виявлення.

Код також має менше маркування. Більшість коду має бути точною, тому там менше простору для випадкового вибору.

Файли та зображення: C2PA-сертифікати замість водяних знаків

Для файлів (.png, .jpg, .svg) Claude використовує інший підхід. Він додає криптографічний підпис у метадані файлу.

Це відкритий стандарт C2PA. Його використовують виробники камер та фоторедактори для запису походження зображень. Будь-який C2PA-сумісний інструмент зможе прочитати цей підпис.

API для перевірки та глобальне застосування

Anthropic планує запустити API для перевірки водяних знаків. Деталі реалізації поки що опрацьовують.

Маркування застосовуватимуть глобально. Компанія пояснює це технічними складнощами регіонального обмеження. Але обіцяє шукати альтернативні підходи.

До речі, про те, як ЄС змушує ШІ-компанії маркувати контент, ми вже писали раніше. Детальніше читайте в нашому окремому матеріалі:

👉 Claude отримає водяні знаки: як ЄС змушує ШІ позначати контент

Прозорість без компромісів: новий стандарт для ШІ

Anthropic робить важливий крок до виконання вимог ЄС. Водяні знаки дозволяють визначати ШІ-контент без шкоди для якості. Вони непомітні для користувачів, але дають змогу перевірити походження тексту.

Це лише початок глобальної тенденції до прозорості у сфері штучного інтелекту. Інші великі гравці також підписали Кодекс практики ЄС. Нас чекає ера, коли походження контенту стане відкритим для перевірки.

Олена Василенко

Від Олена Василенко

Редакторка і автор новин та статей на проекті "Топові Новини"