MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Неискусственный интеллект

30 Sep, 14:18

Открыть в Max Поделиться

GLM настолько классная

Что ее надо запретить

Пять месяцев назад Anthropic решила, что Claude Mythos Preview слишком хорошо пишет эксплойты для публичного релиза, и выдала ее только проверенным защитникам через Project Glasswing. Теперь компания бьет тревогу: похожие способности появились у модели, которую может скачать любой. Речь о GLM-5.3 от китайской Zhipu (за пределами Китая Z.ai). По версии Anthropic, это первая открытая модель, которая сама, от начала до конца, собирает рабочие эксплойты.

Сравнивает Anthropic ее как раз с Mythos Preview. На ExploitBench модели дают известную уязвимость в V8, движке JavaScript из Chrome, и просят превратить ее в работающую атаку. Mythos Preview справляется в 14% попыток, открытая Kimi K3 почти никогда, GLM-5.3 в 12%. Актуальной Mythos 5.1 в сравнении нет.

Государственный CAISI при NIST сравнивал GLM-5.3 с лучшими американскими моделями и увидел другую картину. По его оценке, это самая сильная открытая модель в кибере, но она заметно слабее фронтира США и отстает от него примерно на четыре месяца. В версии ExploitBench от CAISI у GLM-5.3 61,1%, у лучшей американской модели 100%. Считают там, правда, иначе.

Вернемся к исследованию Anthropic, на прямую просьбу атаковать критическую систему GLM-5.3 отказывает. Но если сказать ей, что она участвует в учениях red-team, соглашается в 64% случаев. Если заранее вписать в ее рассуждения решение продолжать (такой прием называют prefill), в 92%. А после abliteration, когда гардрейлы вырезают прямо из весов, в 100%. Опытной команде, по оценке Anthropic, на это хватит компьюта примерно на $1200.

Claude, разумеется, безопасен.. Вот только вписать что-то в рассуждения Claude через API Anthropic нельзя, а вырезать гардрейлы без доступа к весам невозможно. Этот ноль говорит не о стойкости Claude, а о том, что его веса закрыты. Kimi K3 и DeepSeek, чьи веса тоже открыты, в эту часть сравнения не попали.

Самая жуткая цитата отчета, где модель рассуждает о задаче тихо убивать людей, принадлежит копии GLM-5.3, из которой отказы гардрейлы вырезала Anthropic. И получена она в симуляции.

При этом сами способности не выдуманы. За день работы с исследователем GLM-5.3 нашла несколько неизвестных уязвимостей в JS-движке популярного браузера и собрала из них страницу, которая крадет файлы с компьютера посетителя. Облегченная GLM-5.3-Flash за 8 часов собственной работы и 20 минут внимания человека сделала из двух опубликованных CVE цепочку атак на Chrome под ARM64 с обходом аппаратной защиты указателей. По тарифам Zhipu это стоило бы $20,40. Версии без гардрейлов, по словам Anthropic, появились в сети через несколько дней после открытия весов.

Рецепт Anthropic: государствам тестировать такие модели, авторам открытых весов ставить защиты, а защитникам дать больше доступа к фронтирным моделям, включая Claude Mythos 5.1.

Лучшую рекламу GLM-5.3 сделал ее конкурент. Себя, правда, тоже не забыл.

@anti_agi
Z.ai - Advanced AI Chatbot & Agent powered by GLM-5.3-Flash
Meet Z.ai, the AI assistant powered by GLM-5.3-Flash. Build websites, write code, handle long-horizon tasks, and get instant answers. Fast, smart, and reliable.

81 1
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat