Перейти к содержанию

Искусственный интеллект

OpenAI раскрыла подробности новой системы водяных знаков для текста в ChatGPT, Codex и API

OpenAI раскрыла подробности новой системы водяных знаков для текста в ChatGPT, Codex и API

Сегодня OpenAI объявила, как будет соблюдать Закон ЕС об искусственном интеллекте, который требует от поставщиков генеративных ИИ-систем помечать созданный ИИ текст так, чтобы его можно было распознать. Рассказываем подробности.

Немного контекста

Несколько месяцев назад Anthropic вызвала споры, объявив, что в соответствии с Законом ЕС об ИИ Claude начнёт ставить водяные знаки на текст, слегка корректируя выбор слов.

Если вкратце, Claude время от времени выбирает между словами, которые одинаково хорошо подошли бы по скрытому шаблону. По словам Anthropic, это никак не влияет на смысл, качество или удобочитаемость ответов.

Anthropic также разработала детектор, способный искать этот шаблон в тексте и определять, вероятно ли, что он был создан Claude.

С помощью детектора нельзя определить, был ли текст создан OpenAI или другим конкурентом: водяной знак Claude генерируется с использованием секретного ключа, уникального для системы Anthropic.

В разгар споров Anthropic подчеркнула, что Claude будет не единственной системой с такой функцией, отметив, что несколько других крупных поставщиков ИИ также внедряют системы маркировки, чтобы соответствовать требованиям ЕС.

Сегодня OpenAI представила собственное решение, основанное на схожем подходе, но с гораздо более ограниченным внедрением и сферой применения.

Система OpenAI для маркировки текста водяными знаками

По словам OpenAI, «клиенты API по всему миру уже сегодня смогут включить маркировку текста водяными знаками для отдельных моделей», а компания «в ближайшие недели добавит невидимый водяной знак в текст, созданный подходящими для этого версиями ChatGPT и Codex в Европейском союзе».

Это означает, что в API маркировка текста водяными знаками пока останется выключенной по умолчанию, а в ChatGPT и Codex изначально будет доступна только подходящим пользователям в Европейском союзе.

OpenAI также открыла приём заявок на доступ к детектору водяных знаков в тексте. На начальном этапе доступ получат только одобренные исследователи и экспертные организации: компания будет оценивать и совершенствовать эту технологию.

Говоря о точности, OpenAI прямо признаёт, что технология обнаружения всё ещё имеет существенные ограничения: она может давать как ложноотрицательные, так и ложноположительные результаты, особенно на коротких текстах или материалах в отдельных областях, «например, в математике, где выбор слов менее гибок».

Вот что OpenAI рассказывает о textGrain — своей технологии маркировки текста водяными знаками:

Наша технология маркировки текста водяными знаками textGrain добавляет невидимый статистический сигнал в выбор слов моделью. Наш детектор ищет этот сигнал, чтобы определить, содержит ли отрывок водяной знак OpenAI. Подробнее о принципе работы textGrain можно узнать из нашего технического отчёта⁠, который в ближайшие недели будет дополнен новыми сведениями. Мы также планируем открыть исходный код технологии, чтобы другие могли развивать её дальше.

Компания также отметила, что водяной знак не только сложнее обнаружить в коротких текстах, но и его можно значительно ослабить редактированием:

При проверке отрывков объёмом 400 токенов замена 10% слов синонимами снизила точность обнаружения примерно с 92% до 66%. Замена 25% слов снизила её до 17%.

Любопытно, что в сравнении OpenAI текстов с водяными знаками и без них первые показали немного более высокие результаты в нескольких тестах, хотя компания заявила, что не обнаружила значимой разницы в общей производительности.

Тест Текст без водяного знака (Astra, макс.) Текст с водяным знаком (Astra, макс.)
Artificial Analysis Intelligence Index 49,57 балла 49,76 балла
AutomationBench 34,09% 34,86%
DeepSWE v1.1 72,80% 71,68%
Terminal-Bench 4.0 53,90% 56,06%
Terminal-Bench Science 0.1 56,90% 60,00%
BrowseComp 87,92% 87,35%
HealthBench Professional 64,27% 64,60%
GPQA Diamond 94,44% 93,94%

OpenAI также подчеркнула, что помимо проблем с ложноположительными и ложноотрицательными результатами водяной знак «не измеряет вклад человека», «не устанавливает авторство или ответственность», «не позволяет установить личность пользователя» и «не подтверждает достоверность».

OpenAI добавила, что «отсутствие обнаруженного водяного знака также не доказывает, что текст написан человеком».

Наконец, компания заявила, что планирует пересматривать свой подход по мере развития технологий, стандартов и накопления данных. Она продолжит изучать, насколько хорошо водяные знаки сохраняются после редактирования и перевода и позволяют ли они лучше отличать использование ИИ в качестве помощника от авторства ИИ.

Чтобы прочитать полное объявление OpenAI, перейдите по этой ссылке.

Что вы думаете о том, как OpenIA внедряет маркировку текста водяными знаками? Поделитесь мнением в комментариях.