OpenAI 5 октября 2026 года опубликовала технический доклад о водяном знаке «textGrain». Его будут автоматически добавлять в тексты ChatGPT и Codex в Европейском союзе. Запуск запланирован «в ближайшие недели». Знак — это статистический след в выборе слов, а не скрытый символ или невидимый пробел. Поэтому он ничего не доказывает наверняка о том, кто написал текст.
Причина — статья 50 Закона ЕС об искусственном интеллекте. С 2 августа 2026 года она требует помечать результат работы систем, которые создают текст, изображения, звук и видео. Пометку должна уметь считывать машина, а сам материал должно быть можно распознать как созданный искусственным интеллектом. Европейская комиссия 10 июня 2026 года опубликовала окончательный Кодекс добросовестной практики по этим вопросам. Он добровольный, но по нему можно доказать, что правило соблюдено. По кодексу, ни один способ в одиночку не выполняет требования. Поэтому компаниям нужно использовать не меньше двух слоёв маркировки, например метаданные и водяной знак.
Статистический след в выборе слов
Языковая модель пишет слово за словом. Каждый раз она выбирает из нескольких подходящих вариантов. «textGrain» заменяет часть этой случайности значениями, которые считают по секретному ключу и по предыдущим словам. Тот, у кого есть ключ, может проверить, следует ли текст этой схеме чаще, чем получилось бы случайно. Если скопировать и вставить ответ без изменений, знак не пропадёт.
Сам текст внешне не меняется. Поэтому знак не виден ни в текстовом редакторе, ни в электронном письме. По данным OpenAI, в коротких ответах, примерно до 150 английских слов, сигнал слишком слабый. В коде, математике и строго фактических ответах у модели мало способов перефразировать мысль, поэтому знак там поставить трудно.
Лучше всего детектор работает на длинных текстах. На отрывках в 400 токенов (так называют части слов, с которыми работает модель) он находит знак примерно в 95% случаев. На отрывках в 200 токенов — примерно в 80%. Результат зависит и от языка: от 42,2% для румынского до 69,0% для испанского. Данных по болгарскому в источниках нет.
Редактура стирает знак
Если заменить 25% слов, знак находят только в 17% случаев. OpenAI признаёт, что перефразирование и перевод стирают его. Исследование SynthID, похожей технологии Google, показало то же самое: при лёгком перефразировании и переводе точность резко падает. Есть и другая атака, когда текст ИИ смешивают с большим количеством человеческого текста. Тогда больше половины текстов без пометки ошибочно признают помеченными.
Школьник или студент, который перепишет ответ своими словами, скорее всего, не оставит следа. При этом отсутствие знака не доказывает, что текст написал человек. Если ChatGPT лишь исправил в тексте орфографию, знак может остаться. Его обнаружение говорит, что ИИ участвовал в работе, но не показывает, сколько правил человек.
Детектор доступен только одобренным организациям
Детектор ошибается в обе стороны. Он может найти знак там, где его нет, или пропустить там, где он есть. Пока детектор не открыт для всех. OpenAI даёт его только одобренным исследователям и экспертным организациям, среди которых Корнеллский университет, ETH Цюрих и KInIT. Кодекс требует, чтобы позже доступ получили регуляторы, правоохранительные органы, СМИ и проверяющие факты.
Правило ЕС требует и от тех, кто публикует текст ИИ по вопросам, важным для общества, указывать это. Исключение — случай, когда текст прошёл через редактуру человека и кто-то взял на себя редакторскую ответственность.
Раньше OpenAI, 11 августа 2026 года, Anthropic объявила, что ставит невидимый знак в тексты своих моделей, выпущенных с 2 августа 2026 года. Компания предупредила, что знак не доказывает авторство, а сильная редактура, перефразирование и короткие отрывки его стирают. По мнению критиков, правило ЕС требует, чтобы знак было трудно отделить от содержания, а текстовые знаки убираются легко. Доступ к программному интерфейсу для клиентов по всему миру остаётся по желанию и по умолчанию отключён. Для уже работающих систем срок выполнения требований — 2 декабря 2026 года.
Комментарии (1)
Ей, ама хайде сега! "Статистически знак"?! Сериозно ли? Някой да обясни НА баба ми к'во е тоя статистически знак - все едно ще го татуират на текста. И какво печелим от това всъщност? Че ако някой си е написал нещо и после го прегледа, бе, изчезва знака! Каква работа свършваме тогава