OpenAI добавит невидимые метки в тексты ChatGPT
OpenAI начала внедрять технологию textGrain — она добавляет в тексты ChatGPT и Codex невидимые «водяные знаки». Изменения начнут действовать в течение нескольких недель.
Технология textGrain не вставляет в текст никаких видимых символов, лишних пробелов или особой пунктуации. Вместо этого алгоритм слегка корректирует статистические закономерности: при генерации он меняет вероятности выбора тех или иных слов и токенов по определённому шаблону. В результате в тексте формируется незаметный для человеческого глаза паттерн. А специальный детектор, зная секретный ключ, может этот след выявить
Главная причина — требования Закона ЕС об искусственном интеллекте (EU AI Act). Он вступил в силу в августе 2024 года и обязывает разработчиков делать контент, созданный генеративными моделями, распознаваемым для других систем — то есть помечать его машиночитаемым способом.
По обнаруженному сигналу нельзя вычислить конкретного пользователя, его аккаунт, исходный запрос или историю переписки с чат-ботом. Метка лишь сигнализирует, что при создании или редактировании фрагмента участвовала модель OpenAI. Она не доказывает, что весь текст написан ИИ, не показывает, какой именно вклад внёс человек, и не гарантирует правдивость содержания
В коротких фрагментах (около 200 токенов) детектор находит метку примерно в 80% случаев, а в более объёмных (около 400 токенов) — уже в 95%. Если заменить часть слов синонимами, точность падает. Например, замена 10% слов снизила показатель обнаружения примерно с 92% до 66%, а после замены четверти слов — до 17%.
В текстах с жёсткой структурой (математические решения, код) или после перевода детектор работает хуже.
https://openai.com/index/eu-text-provenance/
OpenAI начала внедрять технологию textGrain — она добавляет в тексты ChatGPT и Codex невидимые «водяные знаки». Изменения начнут действовать в течение нескольких недель.
Технология textGrain не вставляет в текст никаких видимых символов, лишних пробелов или особой пунктуации. Вместо этого алгоритм слегка корректирует статистические закономерности: при генерации он меняет вероятности выбора тех или иных слов и токенов по определённому шаблону. В результате в тексте формируется незаметный для человеческого глаза паттерн. А специальный детектор, зная секретный ключ, может этот след выявить
Главная причина — требования Закона ЕС об искусственном интеллекте (EU AI Act). Он вступил в силу в августе 2024 года и обязывает разработчиков делать контент, созданный генеративными моделями, распознаваемым для других систем — то есть помечать его машиночитаемым способом.
По обнаруженному сигналу нельзя вычислить конкретного пользователя, его аккаунт, исходный запрос или историю переписки с чат-ботом. Метка лишь сигнализирует, что при создании или редактировании фрагмента участвовала модель OpenAI. Она не доказывает, что весь текст написан ИИ, не показывает, какой именно вклад внёс человек, и не гарантирует правдивость содержания
В коротких фрагментах (около 200 токенов) детектор находит метку примерно в 80% случаев, а в более объёмных (около 400 токенов) — уже в 95%. Если заменить часть слов синонимами, точность падает. Например, замена 10% слов снизила показатель обнаружения примерно с 92% до 66%, а после замены четверти слов — до 17%.
В текстах с жёсткой структурой (математические решения, код) или после перевода детектор работает хуже.
https://openai.com/index/eu-text-provenance/
https://openai.com/index/eu-text-provenance/