Технология маркировки и соблюдение стандартов

Компания Anthropic опубликовала подробности о том, как будет работать система маркировки текстов, созданных чат-ботом Claude. Это решение принято в рамках соблюдения требований Кодекса практики ЕС в области ИИ (EU AI Act), который обязывает разработчиков внедрять системы, позволяющие идентифицировать контент, созданный искусственным интеллектом.

В основе метода лежит подход SynthID-Text, разработанный командой Google DeepMind. Суть технологии заключается в создании скрытых паттернов в ответах модели. Эти паттерны незаметны для обычного читателя, но легко распознаются специальным ключом, который позволяет однозначно определить принадлежность текста к ИИ.

Влияние на качество и обход системы

Anthropic подчеркивает, что внедрение маркировки не влияет на качество ответов Claude: для пользователя текст остается неотличимым от обычного человеческого текста. Однако компания признает, что полностью скрыть маркировку может только полный перефраз текста, где каждое слово заменено на другое.

Если текст был лишь слегка отредактирован пользователем, маркировка, скорее всего, сохранится. Если же текст был полностью переписан человеком, «прикрепить» к нему водяной знак становится практически невозможно, так как в нем почти нет оригинальных слов, сгенерированных моделью.

Маркировка программного кода

Особое внимание уделено программному коду. Anthropic отмечает, что в коде маркировка будет применяться реже, чем в обычном тексте. Это связано с тем, что у разработчика при написании кода гораздо меньше свободы в выборе терминов, чем в художественном тексте. В ситуациях, когда между вариантами слов есть лишь произвольный выбор, маркировка может быть использована, например, в комментариях к коду, но она не должна влиять на функциональность самого программного обеспечения.

Anthropic также отметила, что они не единственные, кто идет по этому пути: другие крупные разработчики ИИ-моделей уже подписали аналогичный Кодекс практики и также внедряют свои системы маркировки.