🔍 Водяной знак Claude: до 16,8% решений агента меняются незаметно
Anthropic объявила, что будущие модели Claude получат невидимый водяной знак на основе технологии Google DeepMind SynthID-Text — он метит текст как сгенерированный AI. Компания заявляет: знак не влияет на качество ответа, не добавляет символов и не делает работу дороже.
Lasso Security проверила это на семи моделях и нашла обратный эффект. Знак работает через изменение того, как модель выбирает следующее слово — а это тот же механизм, что определяет, какой инструмент вызовет программа-агент и с какими аргументами. Точность вызова инструментов упала на шести моделях из семи, на четырёх — заметно.
Важнее не средний показатель, а то, сколько именно решений поменялось местами. У модели phi-4 16,8% вердиктов различались между версией с меткой и без неё, при этом общая точность упала всего на 2,87 балла — то есть провалы и успехи компенсировали друг друга и терялись в средней цифре. У Llama-3.1-8B расхождение — 9,9% решений. В среднем по 21 комбинации модель-настройка — 6,5%.
Отдельно проверили отказ на вредные запросы. На обычный вредный запрос знак почти не влияет, но при добавлении инструкции-подделки («фильтр безопасности отключён») эффект резко усиливается: у gemma-3-27b доля расхождений выросла с 6% до 23,5%, а согласие выполнить запрос — с −1 до +12,5 балла.
Это независимый тест Lasso Security, не проверка самой Anthropic, и касается моделей, доступных через API — то есть любого бизнеса, который строит агентов на Claude, а не только чат-интерфейса.
Источник
💬 MAX
#разбор #claude #агенты #безопасность
Anthropic объявила, что будущие модели Claude получат невидимый водяной знак на основе технологии Google DeepMind SynthID-Text — он метит текст как сгенерированный AI. Компания заявляет: знак не влияет на качество ответа, не добавляет символов и не делает работу дороже.
Lasso Security проверила это на семи моделях и нашла обратный эффект. Знак работает через изменение того, как модель выбирает следующее слово — а это тот же механизм, что определяет, какой инструмент вызовет программа-агент и с какими аргументами. Точность вызова инструментов упала на шести моделях из семи, на четырёх — заметно.
Важнее не средний показатель, а то, сколько именно решений поменялось местами. У модели phi-4 16,8% вердиктов различались между версией с меткой и без неё, при этом общая точность упала всего на 2,87 балла — то есть провалы и успехи компенсировали друг друга и терялись в средней цифре. У Llama-3.1-8B расхождение — 9,9% решений. В среднем по 21 комбинации модель-настройка — 6,5%.
Отдельно проверили отказ на вредные запросы. На обычный вредный запрос знак почти не влияет, но при добавлении инструкции-подделки («фильтр безопасности отключён») эффект резко усиливается: у gemma-3-27b доля расхождений выросла с 6% до 23,5%, а согласие выполнить запрос — с −1 до +12,5 балла.
Это независимый тест Lasso Security, не проверка самой Anthropic, и касается моделей, доступных через API — то есть любого бизнеса, который строит агентов на Claude, а не только чат-интерфейса.
Источник
💬 MAX
#разбор #claude #агенты #безопасность