💻 Технические показатели и результаты тестов:
1️⃣ В испытании на воспроизведение реальной уязвимости и создание патча в бенчмарке Artificial Analysis Cyber Index модель достигла 82%, показав наивысший результат среди всех протестированных систем.
2️⃣ В соревновательном наборе Cybench из 40 прикладных задач модель успешно решила 93% заданий.
3️⃣ Во внутренних тестах разработчиков система подтвердила применимость для анализа вредоносного ПО, приоритизации уязвимостей и составления правил обнаружения угроз.
4️⃣ В агентском программировании на бенчмарке Coding Agent Index результат составил 49,8%, что позволило обойти DeepSeek V4 Pro 0813 и Qwen3.8 Max.
5️⃣ В тесте на устойчивость к непрямым промпт-инъекциям Lakera B3 система успешно отразила 93,3% атак.
Позиционирование релиза вокруг идеи цифрового суверенитета выглядит как выверенный коммерческий расчёт. Mistral предлагает платформу Mistral Forge для обучения и адаптации моделей, при этом саму ML4 позволяет развёртывать в частных облаках и на собственных серверах заказчиков для автономных операций безопасности.
Сейчас разработчики проводят тестирование методом red-teaming в реальных условиях с привлечением лидеров в сфере кибербезопасности, проверенных партнёров и государственных ведомств, которые получат доступ к модели с пониженным уровнем модерации и расширенными возможностями для задач информационной безопасности.
Публикация весов ожидается только к концу месяца, поэтому до полноценной независимой проверки со стороны мирового сообщества все выводы опираются на заявления самих создателей и партнёрские отчёты.
✋ @Russian_OSINT
1️⃣ В испытании на воспроизведение реальной уязвимости и создание патча в бенчмарке Artificial Analysis Cyber Index модель достигла 82%, показав наивысший результат среди всех протестированных систем.
2️⃣ В соревновательном наборе Cybench из 40 прикладных задач модель успешно решила 93% заданий.
3️⃣ Во внутренних тестах разработчиков система подтвердила применимость для анализа вредоносного ПО, приоритизации уязвимостей и составления правил обнаружения угроз.
4️⃣ В агентском программировании на бенчмарке Coding Agent Index результат составил 49,8%, что позволило обойти DeepSeek V4 Pro 0813 и Qwen3.8 Max.
5️⃣ В тесте на устойчивость к непрямым промпт-инъекциям Lakera B3 система успешно отразила 93,3% атак.
Позиционирование релиза вокруг идеи цифрового суверенитета выглядит как выверенный коммерческий расчёт. Mistral предлагает платформу Mistral Forge для обучения и адаптации моделей, при этом саму ML4 позволяет развёртывать в частных облаках и на собственных серверах заказчиков для автономных операций безопасности.
Сейчас разработчики проводят тестирование методом red-teaming в реальных условиях с привлечением лидеров в сфере кибербезопасности, проверенных партнёров и государственных ведомств, которые получат доступ к модели с пониженным уровнем модерации и расширенными возможностями для задач информационной безопасности.
Публикация весов ожидается только к концу месяца, поэтому до полноценной независимой проверки со стороны мирового сообщества все выводы опираются на заявления самих создателей и партнёрские отчёты.
✋ @Russian_OSINT