MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Python/ django

22 Sep, 12:25

Открыть в Max Поделиться

Prism ML собрала тернарную версию Qwen3.8-27B

Bonsai 2 27B https://prismml.com/news/bonsai-2-27b)' rel='nofollow' target='_blank'>(https://prismml.com/news/bonsai-2-27b)' rel='nofollow' target='_blank'>https://prismml.com/news/bonsai-2-27b)
 - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.

Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсомhttps://prismml.com/news/bonsai-8b)' rel='nofollow' target='_blank'> (https://prismml.com/news/bonsai-8b)' rel='nofollow' target='_blank'>https://prismml.com/news/bonsai-8b)
 первой версии моделей Bonsai.

Основатель и руководитель - профессор Калтеха Бабак Хассибhttps://www.ee.caltech.edu/people/hassibi),' rel='nofollow' target='_blank'>и (https://www.ee.caltech.edu/people/hassibi),' rel='nofollow' target='_blank'>https://www.ee.caltech.edu/people/hassibi),
специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.

Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.

Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.

Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.

В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.

Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.

🟡В релизе три варианта

🟢GGUF в двух упhttps://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)' rel='nofollow' target='_blank'>аковках: (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)' rel='nofollow' target='_blank'>https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)
 PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);

🟢сборкhttps://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)' rel='nofollow' target='_blank'>а под MLX (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)' rel='nofollow' target='_blank'>https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)
 на 8,60 ГБ вместе со зрением;

🟠тестоваhttps://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf-dev)' rel='nofollow' target='_blank'>я упаковка (https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf-dev)' rel='nofollow' target='_blank'>https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf-dev)
 Q2_0 для доработки ядер.

Для GGUF нужен специальный форhttps://github.com/PrismML-Eng/llama.cpp)' rel='nofollow' target='_blank'>к llama.cpp (https://github.com/PrismML-Eng/llama.cpp)' rel='nofollow' target='_blank'>https://github.com/PrismML-Eng/llama.cpp)
 от Prism ML, для MLX - загрузчик из самого пакета.

🟡Бенчмарки

Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.

Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.

AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.

LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.

BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.

MMMU-Pro: 75,49 против 81,73.

Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.


📌Лицензирование: https://prismml.com/news/bonsai-2-27b)' rel='nofollow' target='_blank'>Apache 2.0


🟡Блогпост (https://prismml.com/news/bonsai-2-27b)' rel='nofollow' target='_blank'>https://prismml.com/nehttps://huggingface.co/collections/prism-ml/bonsai-2)' rel='nofollow' target='_blank'>ws/bonsai-2-27b)
🟡Веса (https://huggingface.co/collections/prism-ml/bonsai-2)' rel='nofollow' target='_blank'>https://huggingface.co/collections/prism-https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf)' rel='nofollow' target='_blank'>ml/bonsai-2)
🟡Техотчет (https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf)' rel='nofollow' target='_blank'>https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepapehttps://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels)' rel='nofollow' target='_blank'>r.pdf)
🟡Демо на WebGPU (https://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels)' rel='nofollow' target='_blank'>https://huggingface.co/spaces/webml-community/ternary-bonsai-2-webgpu-kernels)https://discord.gg/prismml)' rel='nofollow' target='_blank'>
🟡Сообщество в Discord (https://discord.gg/prismml)' rel='nofollow' target='_blank'>https://discohttps://github.com/PrismML-Eng/Bonsai-demo/)' rel='nofollow' target='_blank'>rd.gg/prismml)
🖥GitHub (https://github.com/PrismML-Eng/Bonsai-demo/)' rel='nofollow' target='_blank'>https://github.com/PrismML-Eng/Bonsai-demo/)


#AI #ML #LLM #Bonsai #PrizmML
https://prismml.com/news/bonsai-2-27b)

411 6
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat