Главный редактор

Компания Anthropic делится более подробной информацией о том, как будут работать новые водяные знаки Клода.

В пятницу компания Anthropic опубликовала в блоге сообщение, в котором попыталась ответить на некоторые основные вопросы о том, как она будет наносить водяные знаки на текст, генерируемый её чат-ботом Клодом. Например: Как именно будет работать водяной знак? Можно ли его скрыть при редактировании? И как это повлияет на код?

Компания Anthropic делится более подробной информацией о том, как будут работать новые водяные знаки Клода.

Пользователи Claude активно обсуждают это решение с тех пор, как компания на этой неделе объявила о внедрении водяных знаков для соблюдения Кодекса прозрачности Закона ЕС об искусственном интеллекте, который требует от ИИ-компаний использовать системы, позволяющие идентифицировать контент, созданный с помощью ИИ.

На Reddit, например, один пользователь охарактеризовал это как заговор против невинных пользователей Claude, в то время как другой заявил: «Единственная причина не хотеть этого — чтобы обманывать людей». А Business Insider сообщает, что десятки пользователей в X заявили о том, что отказываются от подписки на Claude в связи с этим.

Новое сообщение Anthropic начинается с общего обзора концепции водяных знаков, объясняя, что при принятии «малозначимых решений» — например, при выборе между словами «пасмурно» и «серо» для описания погоды — Claude может создавать в своих ответах шаблон, который «незаметен для читателя, но обнаруживается тем, у кого есть ключ для его расшифровки».

«Водяной знак не влияет на качество ответов Claude», — заявила компания. «Для читателя ответ с водяным знаком неотличим от ответа без него».

Более конкретно, Anthropic сообщила, что будет использовать подход SynthID-Text, описанный командой Google DeepMind в 2024 году, и планирует выпустить API для обнаружения водяных знаков. Также было отмечено, что водяной знак отличается от подходов к обнаружению ИИ, предлагаемых такими компаниями, как Pangram, которые ищут в тексте характерные признаки (например, конструкцию «это не [X], а [Y]»), чтобы выявить использование ИИ: «Обнаружение этих паттернов принципиально отличается от проверки наличия водяного знака».

Может ли кто-то просто переписать текст, чтобы скрыть водяной знак? Anthropic заявила, что это возможно, но «лёгкое редактирование, вероятно, не удалит водяной знак полностью», в то время как «полная перезапись, где заменяется каждое слово, — да».

«В последнем случае, конечно, спорно, можно ли такой текст всё ещё называть сгенерированным ИИ», — отметила компания.

Что касается того, будет ли водяной знак обнаруживаться в тексте, который был лишь вычитан или отредактирован Claude, Anthropic заявила, что это будет зависеть от «длины текста и того, насколько интенсивно Claude его редактировал». Если текст был лишь слегка отредактирован, то «почти все слова» написаны человеком, и «водяному знаку почти не к чему прикрепиться».

Что касается кода, то в нём водяной знак должен быть менее заметен, поскольку модели необходимо создавать рабочий код, и у неё нет свободы выбора между различными равнозначными вариантами.

«Тем не менее, в тех местах, где существует произвольный выбор между определёнными словами или терминами в коде, водяной знак может быть использован, например, в комментариях в коде», — заявили в Anthropic. «Но по определению его влияние на фактически создаваемый код будет незначительным».

Anthropic также заявила, что Claude не будет единственным ИИ-чат-ботом, генерирующим текст с водяными знаками, поскольку «другие крупные разработчики моделей также подписали этот Кодекс практик и будут внедрять свои собственные водяные знаки».

avatar
Главный редактор

0 комментариев