ai and society14 мин чтения

Anthropic начала помечать тексты Claude водяным знаком — и 1922 судебных дела показывают, чего это не решает

11 августа 2026 года Anthropic начала помечать написанное Claude так, чтобы происхождение можно было отследить. Метка переживает копирование и даже перевод, но исчезает при переписывании. Понятное объяснение: как работает текстовый водяной знак, что доказывает и чего не доказывает результат проверки, почему важна история ложных обвинений и почему все 1922 зафиксированных случая галлюцинаций прошли бы эту проверку.

K
Ken Jo
#ai-watermark#synthid#ai-detection#eu-ai-act#ai-transparency#ai-hallucination#provenance#ai-policy

11 августа 2026 года Anthropic начала помечать водяным знаком текст, который пишет Claude, а через три дня опубликовала понятный FAQ о том, как это устроено. Повод не загадочен: статья 50 Регламента ЕС об ИИ, обязывающая поставщиков помечать машинно генерируемый вывод в машиночитаемом виде, начала применяться со 2 августа.

Итак, появилась реальная возможность. Значительная часть написанного ИИ текста, который сейчас в обороте, несёт сигнал, который при подходящих условиях можно проследить до породившей его модели.

А теперь то, на чём стоит задержаться. В тот же день, когда эта метка вышла в свет, публичная база судебных решений по контенту с ИИ-галлюцинациями показывала 1922 дела. Ни одно из них не было сбоем водяного знака. Каждое было сбоем проверки: кто-то подал в суд, опубликовал или выставил счёт за вывод модели, не убедившись, что упомянутое в нём существует. Водяной знак обнаружил бы их все и не предотвратил бы ни одного. Эта статья — про этот разрыв: как маркировка работает простыми словами, что результат проверки на самом деле доказывает и чего он не докажет, каким бы хорошим ни стал.

Коротко:

  • В текст ничего не добавляется. Модель лишь смещает секретным ключом выбор между несколькими одинаково подходящими следующими словами. Никаких скрытых символов, никаких метаданных, никакой платы скоростью или деньгами — и это включено для всех и везде.
  • Положительный результат — слабая улика, отрицательный — почти никакая. Anthropic сама пишет, что метка не отличает «Claude это написал» от «Claude это сильно отредактировал», слаба на коротких текстах, коде и чисто фактических фрагментах и стирается переписыванием. В 2024 году исследователи показали, что меньше чем за 50 долларов можно и удалить такие метки, и подделать их на тексте, написанном человеком.
  • Происхождение — не проверка. Метка сообщает, какая модель прошлась по тексту. Она никогда не сообщает, существует ли названное в нём решение суда, ссылка или книга.

Раскрытый паспорт: разворот, плотно покрытый пограничными штампами разных стран, отпечатанный на защищённой бумаге с бледным узорным фоном

Изображение: Jon Rawlinson, Wikimedia Commons, CC BY 2.0. Страница, полная знаков подлинности. Каждый доказывает, что границу пересекли. Ни один не говорит ни слова о том, сказал ли путешественник правду.

Что Anthropic на самом деле изменила, а что нет

Начнём с механизма, потому что почти все дальнейшие недоразумения растут из ошибки именно здесь.

Когда языковая модель пишет, она выдаёт по одному слову, и в большинстве позиций единственно верного выбора нет. «Встреча была продуктивной» и «Встреча была полезной» одинаково годятся. Модель держит список допустимых следующих слов и выбирает одно случайной жеребьёвкой. Именно поэтому один и тот же запрос дважды даёт немного разные ответы.

Текстовый водяной знак заменяет эту жеребьёвку псевдослучайной, управляемой секретным ключом. Модель по-прежнему выбирает только среди слов, которые сама сочла равноценными, поэтому качество не страдает. Но на протяжении нескольких сотен слов картина того, какое допустимое слово побеждало каждый раз, перестаёт выглядеть совпадением, и владелец ключа может её измерить.

Собственная формулировка Anthropic снимает два самых частых заблуждения: «в текст ничего не добавляется, скрытых символов нет». Ни невидимого Юникода, ни пробелов нулевой ширины, ни блока метаданных, который отвалился бы при вставке в текстовый редактор. Ни изменения стоимости, ни скорости. И это включено глобально: Anthropic говорит, что пока не имеет устойчивого способа ограничить это поведение по регионам, так что пользователь в Сан-Паулу получает то же, что и в Стокгольме.

Ничего научно нового здесь нет. Скотт Ааронсон предложил подход в 2022 году, Кирхенбауэр с коллегами опубликовали рабочую схему на ICML в 2023-м, а Google DeepMind опубликовала SynthID-Text в Nature в октябре 2024 года — реализация Anthropic является её вариантом. Google крутит это в Gemini с 2024 года, сообщая примерно о 20 миллионах реальных ответов без заметной разницы в качестве, и с тех пор заявляет о более чем 10 миллиардах помеченных единиц контента.

Что подводит к тому, что не вышло. Anthropic обещает API для проверки «скоро». Его нет. Цены, доля ложных срабатываний и охват моделей — всё это пока не опубликовано, а публичный портал проверки SynthID от Google, анонсированный в мае 2025 года, до сих пор работает по списку ожидания. Метка присутствует в миллиардах документов; возможность проверить хотя бы один из них для практически всех читателей остаётся обещанием.

Метка переживает копирование. Переписывание она не переживает.

Сигнал живёт в том, какие слова были выбраны. Значит, всё, что сохраняет выбор слов, сохраняет и метку, а всё, что его заменяет, метку разрушает. Anthropic формулирует потолок прямо: «полное переписывание, в котором каждое слово заменено» её удалит. Два случая ломают эту закономерность так, что многих застают врасплох.

Короткие и фактические тексты почти ничего не несут. Водяному знаку нужен выбор, в котором можно спрятаться. Одна-две фразы не дают достаточно решений, чтобы сложилась картина, а насыщенное фактами содержание может вовсе не оставлять выбора: пример Anthropic — после «Principia Ньютона» следующим словом будет «Mathematica», и никакой ключ тут права голоса не имеет. По той же логике слаб код, где синтаксис задаёт большинство токенов, и корректура, где модель меняет слишком мало слов, чтобы оставить сигнал.

Перевод несёт полноценный водяной знак. Это против интуиции. Попросите Claude перевести документ на японский — и японский текст будет заново сгенерирован Claude, слово за словом, с обычной свободой выбора, а значит выйдет полностью помеченным, хотя мысли пришли из непомеченного человеческого оригинала. Это противоположно тому, что исследователи DeepMind описывают в Nature, где перевод уже помеченного текста на другой язык сильно снижает уверенность обнаружения. Верно и то, и другое, потому что это разные сценарии: перевести помеченный текст на стороне — значит смыть метку, а заставить переводить саму модель — значит поставить новую.

Что вы делаете с текстомМетка сохраняется?
Копирование и вставка куда угодноДа — там нет ничего встроенного, что вставка могла бы отсечь
Лёгкая правка: опечатки, заголовки, сокращенияДа — большинство выборов слов не тронуто
Попросить модель перевестиДа — перевод генерируется заново и потому помечен полностью
Глубокий пересказ своими словамиНет — вы заменяете сами выборы, которые несли сигнал
Полное переписывание, каждое слово замененоНет — Anthropic указывает, что это её удаляет
Короткая выдержка в одну-две фразыСлабо или никак — слишком мало выборов для картины
Код или чисто фактические фрагментыСлабо — синтаксис и факты не оставляют модели свободы
Дать модели вычитать ваш черновикСлабо или никак — меняется слишком мало слов

Поведение по описанию Anthropic в FAQ от 14 августа 2026 года и авторов SynthID-Text в Nature, октябрь 2024 года.

Положительный результат — слабая улика. Отрицательный — почти никакая.

Кто-то прогнал документ через детектор и получил результат. Что он узнал?

Если результат положительный: что часть этого текста прошла через модель данного поставщика. И всё. Anthropic прямо заявляет, что метка не отличает «Claude это написал» от «Claude это сильно отредактировал», ничего не говорит об истинности хотя бы одного утверждения внутри и не распознаёт текст другого ИИ, потому что знает только свой ключ.

Если результат отрицательный, он не узнал почти ничего. Чистый результат — ровно то же, что вы получите от глубокого пересказа, короткой выдержки, блока кода, модели конкурента или модели с открытыми весами, работающей у кого-то на ноутбуке вообще без маркировки.

Матрица два на два, показывающая, что подтверждает и чего не подтверждает результат проверки водяного знака при положительном и при отрицательном исходе; каждая ячейка взята из ограничений, опубликованных самими поставщиками

Каждая ячейка здесь — ограничение, которое поставщики опубликовали сами. Источники: FAQ Anthropic о водяном знаке (14 августа 2026 года); Dathathri et al., Nature (октябрь 2024 года); Jovanović, Staab и Vechev, ICML 2024.

Атака, под которую никто не закладывает бюджет, направлена в другую сторону

Стирание — риск, который представляют себе все: кто-то отмывает текст ИИ, чтобы скрыть происхождение. Хорошо. Но есть вторая атака со стрелкой в обратную сторону, и тревожиться стоит именно из-за неё.

Подделка — это когда текст, написанный человеком, заставляют нести чужой водяной знак. Никто ничего не прячет: наоборот, подбрасывают. Мишень — человек, которого затем обвинят в использовании ИИ, или поставщик, на которого повесят вывод, которого он никогда не производил.

На ICML 2024 Йованович, Штааб и Вечев продемонстрировали обе атаки против передовых схем с успехом более 80% и затратами менее 50 долларов на вычисления. Авторы DeepMind признают то же самое в собственной статье в Nature: водяные знаки «не дают полного решения», для самого своего существования требуют сотрудничества поставщика модели, неисполнимы для моделей с открытыми весами, которые любой может запустить как есть, и «уязвимы к атакам кражи, подделки и стирания». Последняя оговорка и есть весь аргумент, написанный командой, создавшей эту технологию.

Эксперимент «обнаружить ИИ» уже проводили. Он завалил не тех студентов.

Инструменты обнаружения уже существуют, и это другая технология с задокументированной историей вреда. Водяной знак ставит владелец модели в момент генерации, с помощью ключа. Классификатор гадает постфактум по признакам самого текста: насколько предсказуем выбор слов, насколько разнообразна лексика. Первый что-то знает. Второй сопоставляет шаблоны стиля. Это разница между измерением и профилированием.

OpenAI запустила AI Text Classifier 31 января 2023 года и закрыла его 20 июля того же года «из-за низкой точности». Её собственные цифры: поймано 26% текста ИИ, ошибочно помечено 9% человеческого текста.

Затем в июле 2023 года Лян с коллегами опубликовали в Patterns результат, который должен был закрыть всю категорию. На семи детекторах, применённых к эссе TOEFL, написанным неносителями английского, средняя доля ложных срабатываний составила 61,3%; один детектор пометил 97,8% из них. А когда те же эссе попросили переписать более богатой лексикой, доля упала до 11,6%. Детекторы никогда не измеряли авторство: они измеряли беглость и наказывали тех, чей английский проще.

Учреждения посчитали. 16 августа 2023 года — ровно три года назад — Университет Вандербильта отключил ИИ-детектор Turnitin, рассудив, что заявленная доля ложных срабатываний в 1% при 75 000 работ в год означает около 750 несправедливо обвинённых студентов ежегодно.

Водяные знаки заметно лучше этого: они не гадают. Но посмотрите, что перешло по наследству. Режим отказа системы обнаружения — никогда не аккуратное «не знаю», а уверенный ответ о конкретном человеке. Водяные знаки повышают точность положительных результатов. С учётом подделки они не устраняют ложное обвинение, а скорее ставят его изготовление на поток.

Регулирование пришло раньше инструментов

Всё это скучилось в одну неделю потому, что законодатели двинулись первыми.

Регламент ЕС об ИИ делит обязанность надвое. Статья 50(2) связывает поставщиков: тот, кто строит генеративную систему, обязан помечать её вывод машиночитаемо, включая текст. Статья 50(4) связывает вас: тот, кто публикует сгенерированный ИИ текст, «информирующий общественность по вопросам, представляющим общественный интерес», обязан это раскрыть.

И у второй нормы есть исключение, которое для большинства читателей и составляет практическую суть всего режима. Обязанность не применяется, если контент прошёл человеческую проверку или редакционный контроль и есть лицо, несущее за него редакционную ответственность. Перечитайте. Ответ Европы на сгенерированный ИИ текст — не детектор. Это названный поимённо человек, который его проверил и за него отвечает.

Хронология с марта 2025 по февраль 2027 года, отмечающая, когда в каждой юрисдикции вступили в силу правила маркировки ИИ-контента, включая Китай, Корею и поэтапные даты Регламента ЕС об ИИ, вместе с запуском водяного знака Anthropic 11 августа 2026 года

Обязанности маркировки пришли по расписанию, пригодное обнаружение — нет. Источники: Регламент ЕС об ИИ и даты его применения, европейский кодекс практики по прозрачности (июль 2026 года), китайские меры по маркировке и стандарт GB 45438-2025, корейский Базовый закон об ИИ и объявление Anthropic.

Остаток календаря короток. Европейский кодекс практики по прозрачности был признан адекватным 8–9 июля 2026 года и собрал около 190 подписантов, включая Anthropic, Google, Meta, Microsoft, Mistral и OpenAI. 2 декабря 2026 года заканчивается льготный период, и обязанность маркировки распространяется на системы, выведенные на рынок до 2 августа; 2 февраля 2027 года наступает срок по совместимости средств обнаружения. Китайские меры по маркировке действуют с 1 сентября 2025 года и требуют как видимых, так и встроенных меток по стандарту GB 45438-2025, а статья 10 запрещает удалять или подделывать метку. Корейский Базовый закон об ИИ вступил в силу 22 января 2026 года с обязанностями по маркировке и штрафами до 30 миллионов вон. В США федерального требования помечать текст нет вовсе — об этом стоит сказать прямо, потому что правило, которое игнорирует значительная часть моделей на рынке, не является глобальным правилом.

Сюда же относится ещё одно отсутствие. The Wall Street Journal сообщала в 2024 году, что OpenAI разработала метод текстового водяного знака, который внутри компании описывали как точный примерно на 99,9%. Относитесь к этому как к сообщению прессы, а не к факту: цифра никогда независимо не проверялась, и OpenAI никогда не выпускала маркировку текста. Её собственная запись от 11 июня 2026 года о соответствии требованиям ЕС документирует только происхождение изображений и признаёт общее ограничение своими словами: «метаданные могут быть удалены, водяные знаки могут деградировать».

Каждое из этих дел прошло бы проверку водяного знака

Дамьен Шарлотен ведёт публичную базу судебных решений по всему миру, в которых суду пришлось разбираться со сгенерированным ИИ содержимым, содержащим галлюцинации. На момент обращения 16 августа 2026 года она показывала 1922 решения. Траектория: около 200 в середине 2025 года, 719 к январю 2026-го, 1227 к апрелю, 1598 на 9 июня и 1922 сегодня — 324 добавились только за последние десять недель.

Линейный график, показывающий рост числа судебных решений, связанных с ИИ-галлюцинациями, примерно с 200 в середине 2025 года до 1922 на 16 августа 2026 года

Каждая точка на этой кривой несла бы действительный водяной знак. Источник: база данных дел об ИИ-галлюцинациях Дамьена Шарлотена, обращение 16 августа 2026 года.

Архетип — Mata v. Avianca, решение Южного округа Нью-Йорка от 22 июня 2023 года: состязательная бумага со ссылками на шесть несуществующих судебных решений и санкция в 5000 долларов.

Но пример, который должен весить больше всего, принадлежит Anthropic. В мае 2025 года по делу Concord Music v. Anthropic юристы самой компании подали заключение эксперта со ссылкой на исследование, которое Claude выдумал. Ручная проверка это пропустила, адвокат принёс суду извинения. Компания, которая сегодня выпускает текстовый водяной знак, сама обожглась на некритичном цитировании — вывода собственной модели, в собственном процессе, при проверке собственными юристами. Водяной знак на том заключении дал бы чистый и уверенный положительный результат и ничего бы не изменил.

Это выходит за пределы судов. Deloitte Australia в октябре 2025 года согласилась частично вернуть деньги за правительственный отчёт стоимостью 440 000 австралийских долларов, содержавший несуществующие ссылки и выдуманную цитату из судебного решения. 18 мая 2025 года Chicago Sun-Times и Philadelphia Inquirer опубликовали синдицированный список летнего чтения, в котором из пятнадцати книг реальными оказались пять. Лян с коллегами, проанализировав 950 965 статей в arXiv:2404.01268, обнаружили изменённое LLM содержание вплоть до 17,5% в аннотациях по информатике против 6,3% и менее в математике и в портфеле журналов Nature.

Вопрос объёма тоже заслуживает честной цифры, а не пугающей. Анализ Common Crawl, выполненный Graphite и опубликованный в октябре 2025 года, показал, что около 51,7% новых статей в выборке были написаны ИИ в мае 2025 года, — и Axios, сообщая об этом, добавила важную оговорку: доля вышла на плато около половины, а не продолжила расти. Это не потоп. Это новая норма.

Вот в чём суть. Ничто в этом списке не является сбоем водяного знака. В каждом случае происхождение не вызывало сомнений: все знали, что участвовала модель, или сразу бы это приняли. Провалилось то, что никто не открыл ссылку и не проверил, существует ли то дело, то исследование, та книга.

Итог: происхождение — не проверка

Назовём это заблуждением почтового штемпеля. Штемпель доказывает, какое отделение обработало письмо. Он никогда не имел мнения о том, правдиво ли письмо. Мы только что вложили немало инженерных сил в очень хороший почтовый штемпель, и часть публичной дискуссии вот-вот примет его за проверяющего факты.

Держите в голове три вещи сразу. Положительный результат — слабая улика: он устанавливает маршрут, а не авторство, и уж точно не факт. Отрицательный результат — почти никакая улика. И охват структурно неполон по замыслу: он зависит от добровольного участия каждого поставщика, от того, что каждый держит свой ключ, а модели с открытыми весами, которые любой может скачать и запустить как есть, не участвуют ни в чём. И пока что возможность проверить даже не в ваших руках: она за списком ожидания и словом «скоро».

Проверку по-настоящему выдерживает не метка на выводе, а запись, которую можно заново вывести из источника: сохранившаяся аудиозапись, расшифровка с отметками времени, в которую можно вернуться в нужный момент, реплика, приписанная тому, кто её действительно произнёс, утверждение, прослеживаемое до первичного документа, который можно открыть. Мы уже отстаивали это, говоря о синхронном переводе, где проверяемая заметка важнее гладкого вывода, и о расшифровке полицейских допросов, где запись должна выдержать, когда её оспаривают. Эпоха водяных знаков не меняет этот довод, а обостряет его: когда маркировка станет всеобщей, фраза «тут участвовал ИИ» перестанет что-либо различать.

Водяные знаки отвечают, откуда взялся текст. То, что отвечало бы, правдив ли он, ещё никто не построил, потому что это не детектор. Это источник, к которому можно вернуться.


Где здесь Telli.sh: мы строим именно тот источник, к которому можно вернуться. Telli.sh записывает встречу, делает расшифровку с отметками времени и разделением говорящих и держит резюме привязанным к аудио, из которого оно выросло, — так что любую строку в ваших заметках можно и через месяцы проследить до той секунды, когда кто-то это сказал. Это не заявление об обнаружении ИИ. Это вторая половина задачи: когда резюме что-то утверждает, вы можете сверить это с записью, а не верить фразе.

Начать живую ИИ-заметку

Источники


Вернуться в блог