Перейти к содержанию

Статья 50 против перефразирования: что на самом деле умеет маркировка ИИ-текста

Опубликовано
  • Админы
Водяной знак в тексте нейросети: как он устроен
Водяной знак в тексте нейросети: как он устроен

Второго августа 2026 года в Евросоюзе заработала статья 50 Регламента об искусственном интеллекте. Обязанность разработчика генеративной системы там сформулирована коротко: вывод должен быть «помечен в машиночитаемом формате и определяем как искусственно созданный или изменённый», а решения — «эффективными, совместимыми, устойчивыми и надёжными настолько, насколько это технически осуществимо». Системам, выпущенным на рынок раньше, дали отсрочку до 2 декабря 2026 года. Верхняя планка штрафа — 15 млн евро или 3 % мирового оборота.

Для изображений и видео требование выглядит исполнимым: сигнал прячется в пиксели, рядом кладутся подписанные метаданные. С текстом сложнее — и вокруг него успел нарасти слой уверенных представлений, большинство из которых при сверке с первоисточниками не выдерживает.

Первоисточников здесь ровно два: статья авторов SynthID-Text в Nature с измерениями на реальном пользовательском трафике и сам текст регламента вместе с разъяснениями Еврокомиссии. Ниже — пять самых устойчивых представлений, от «водяной знак — это невидимые символы» до «если знак вшит, снять его уже нельзя», и что по каждому говорят цифры.

ℹ️ Справка

Статья 50 адресована двум разным сторонам. Разработчик системы обязан помечать вывод машиночитаемо. Тот, кто систему применяет, обязан раскрывать дипфейки при первом же показе и помечать ИИ-текст, публикуемый «с целью информирования общественности по вопросам общественного интереса» — если только этот текст не прошёл человеческую редактуру и контроль. Проверка орфографии редактурой не считается.

Заблуждение 1. «Водяной знак — это невидимые символы в тексте»

Это описание одного из подходов, причём самого примитивного: подмена обычного пробела на другой пробельный символ Юникода, вставка символов нулевой ширины и тому подобное. Такой знак снимается нормализацией строки — одной командой.

Тот подход, вокруг которого построена регуляторная дискуссия, устроен принципиально иначе: он не добавляет к тексту ничего. Он меняет то, какие именно токены модель выбирает при генерации.

В схеме SynthID-Text это выглядит так. На каждом шаге генерации из последних H = 4 токенов и секретного ключа выводится seed. Seed задаёт набор псевдослучайных функций g₁…g₃₀ — по умолчанию слоёв тридцать. Кандидаты набираются из распределения модели, разбиваются на пары и играют турнир: в каждом слое из пары побеждает токен с большим значением g своего слоя. Победитель последнего слоя и попадает в текст.

Турнирная выборка SynthID-Text: как знак попадает в текст
Турнирная выборка SynthID-Text: как знак попадает в текст

Никакого «водяного знака» в тексте при этом нет — есть статистический перекос в сторону токенов, выигрывающих турнир по ключу. Прочитать его глазами невозможно в принципе.

📌 Заметка

Про гомоглифы и невидимые символы у крупных провайдеров периодически пишут в блогах — например, в разборе Шона Гёдеке от 2 июля 2026 года такое утверждается про OpenAI и Anthropic. Подтверждения от самих компаний найти не удалось, официальных заявлений на этот счёт нет. Считайте это неподтверждённым наблюдением, а не фактом.

Заблуждение 2. «Такая подмена токенов испортит текст»

Интуитивно кажется, что если запрещать модели выбирать лучший токен, качество упадёт. Авторы SynthID-Text проверили это на масштабе, который трудно оспорить: около 20 миллионов ответов Gemini, часть с водяным знаком, часть без.

Разница в пользовательских оценках: доля «палец вверх» отличалась на 0,01 % (в пользу версии со знаком), доля «палец вниз» — на 0,02 % (тоже в пользу версии со знаком). Обе разницы статистически незначимы и укладываются в 95-процентные доверительные интервалы. Отдельно провели ручную оценку 3000 ответов по пяти критериям — грамматичность, релевантность, корректность, полезность, общее впечатление — значимых различий не нашли.

Вычислительная цена тоже небольшая: 15,527 мс на токен без знака против 15,615 мс со знаком на Gemma 7B-IT, то есть +0,57 % к задержке при тридцати слоях.

Так что вот это заблуждение — действительно заблуждение. Заметного налога на качество в опубликованных замерах нет.

Заблуждение 3. «Чтобы проверить текст, нужен доступ к модели»

Нет. Детектору нужны только сам текст (в токенизированном виде) и ключ. Он пересчитывает средние значения g по всем токенам и всем слоям и сравнивает с порогом. Модель, её веса и её API при этом не нужны — что и делает схему пригодной для внешней проверки.

Отсюда, впрочем, и первая практическая проблема: ключ. Пока он секретный, проверить текст может только владелец модели. Как только ключ становится доступен для «совместимости» (которой требует тот же регламент), знак становится и подделываемым, и снимаемым.

❗ Главное

Требование «эффективно, совместимо, устойчиво» и модель безопасности «знак держится на секретности ключа» тянут в противоположные стороны. Это не придирка к формулировке — это структурное противоречие, и в первоисточниках оно не разрешено ни с технической, ни с регуляторной стороны.

Заблуждение 4. «Достаточно одного абзаца, чтобы определить»

Здесь цифры из статьи в Nature довольно отрезвляющие. Для неискажающего варианта на Gemma 7B-IT при температуре 0,7 текст длиной 200 токенов даёт около 90 % обнаружения при 1 % ложных срабатываний. Двести токенов — это примерно 700–900 знаков, то есть абзаца три-четыре.

Дальше — хуже. Надёжность знака растёт с длиной текста и падает с уменьшением энтропии распределения. На коротких ответах, на фактических вопросах с единственно правильным ответом, на коде, на списках — там, где модель почти не имеет выбора между токенами, — вшивать знак попросту некуда. Именно поэтому регламент выводит из-под требования маркировки короткие последовательности символов и исходный код.

⚠️ Осторожно

Один процент ложных срабатываний звучит мало ровно до того момента, пока вы не проверяете тысячу студенческих работ. Тогда это десять человек, обвинённых ни за что. И это цифра лабораторного детектора на собственном знаке — а не тех коммерческих «детекторов ИИ-текста», которые угадывают по перплексии и не имеют ни ключа, ни доступа к статистике модели. У этих последних никакой проверяемой точности не публикуется вовсе, и опираться на их вердикт при принятии решений о людях нельзя.

Заблуждение 5. «Если знак вшит, его уже не убрать»

Убрать можно, и авторы это признают прямо: водяные знаки такого типа «ослабляются правками текста, например перефразированием с помощью языковой модели». Дальше идёт оговорка — «хотя обычно это заметно меняет текст», — но для практики она мало что даёт: пропустить свой текст через другую, пусть даже слабую, модель с инструкцией «перепиши» занимает секунды и стоит копейки. Перевод туда-обратно работает так же.

В том же ряду авторы перечисляют нерешённые вопросы: кража знака, подделка знака (когда чужому человеческому тексту приписывают знак модели) и невозможность заставить соблюдать схему разработчиков открытых моделей. Веса, которые можно скачать и запустить локально, никакого турнирного отбора выполнять не обязаны — а именно на них и работает большая часть самохостящегося ИИ, о котором на форуме была отдельная тема про локальные LLM с OpenAI-совместимым API.

Что из этого следует

Маркировка ИИ-текста — это не механизм доказательства, а механизм гигиены. Она хорошо работает против ленивого массового потока: миллионы сгенерированных отзывов, комментариев и SEO-текстов, которые никто не станет перефразировать, действительно станут отличимыми. Она не работает против того, кто целенаправленно её обходит: одна прогонка через другую модель — и знака нет.

Практический вывод для тех, кто по эту сторону: не стройте процессы на предположении, что происхождение текста можно установить технически. Ни «детектор показал 87 % ИИ» не является основанием для решения о человеке, ни отсутствие знака не является доказательством, что писал человек. А вот к тому, что в ЕС публикуемые «для информирования общественности» материалы теперь требуют пометки, если их не вычитал человек, стоит отнестись серьёзно — ответственность здесь лежит уже на том, кто публикует.

Смежный сюжет о том, как хрупки бывают технические гарантии вокруг вывода моделей, разбирался в теме про вскрытие зашифрованных reasoning-блоков.

Источники

💬 Вопрос к сообществу

Практический вопрос к тем, кто гоняет локальные модели: если требование маркировки в итоге доберётся и до открытых весов, во что оно превратится — в поле в конфиге, которое все отключат первым делом, или в обязанность площадок проверять загружаемый контент? И встречал ли кто-нибудь на практике вменяемый детектор ИИ-текста с опубликованной точностью?

Featured Replies

No posts to show

Присоединяйтесь к обсуждению

Вы можете написать сейчас и зарегистрироваться позже. Если у вас есть аккаунт, авторизуйтесь, чтобы опубликовать от имени своего аккаунта.
Примечание: Ваш пост будет проверен модератором, прежде чем станет видимым.

Гость
К сожалению, ваш контент содержит запрещённые слова. Пожалуйста, отредактируйте контент, чтобы удалить выделенные ниже слова.
Ответить в этой теме...

Последние посетители 0

  • Ни одного зарегистрированного пользователя не просматривает данную страницу
Яндекс.Метрика

Account

Navigation

Поиск

Поиск

Configure browser push notifications

Chrome (Android)
  1. Tap the lock icon next to the address bar.
  2. Tap Permissions → Notifications.
  3. Adjust your preference.
Chrome (Desktop)
  1. Click the padlock icon in the address bar.
  2. Select Site settings.
  3. Find Notifications and adjust your preference.