Bonsai 2
27B от PrismML
Тернарное сжатие Qwen3.8 27B: веса кодируются в {-1, 0, +1} с FP16-скейлингом. Полная модель ужимается больше чем в 9 раз - до 5,9 ГБ, работает локально на обычном железе
• мультимодальность - текст и изображения
• вызов инструментов и длинные агентные сценарии
• сильные reasoning, кодинг и vision
• локальный запуск без облака
• 1,76 эффективных бита на вес
• 98,2% качества полной версии (83,9 против 85,4)
• до 143 токенов/сек на RTX 5090, 46,8 на M5 Max
• контекст 262K токенов
• энергоэффективность на 40% выше полнопрецизионной 8B-модели
Предыдущая версия держала 95% качества, теперь 98,2% - практически без потерь. Запускается на NVIDIA через CUDA и на Apple через MLX. Лицензия Apache 2.0
HF
#optimization #multimodal #agent #coding
27B от PrismML
Тернарное сжатие Qwen3.8 27B: веса кодируются в {-1, 0, +1} с FP16-скейлингом. Полная модель ужимается больше чем в 9 раз - до 5,9 ГБ, работает локально на обычном железе
• мультимодальность - текст и изображения
• вызов инструментов и длинные агентные сценарии
• сильные reasoning, кодинг и vision
• локальный запуск без облака
• 1,76 эффективных бита на вес
• 98,2% качества полной версии (83,9 против 85,4)
• до 143 токенов/сек на RTX 5090, 46,8 на M5 Max
• контекст 262K токенов
• энергоэффективность на 40% выше полнопрецизионной 8B-модели
Предыдущая версия держала 95% качества, теперь 98,2% - практически без потерь. Запускается на NVIDIA через CUDA и на Apple через MLX. Лицензия Apache 2.0
HF
#optimization #multimodal #agent #coding