⚡️125 миллиардов параметров, работают 6
Alibaba выложила Qwen3.8-Flash-Next. Веса открыты, лицензия Apache 2.0, забирать с Hugging Face и ModelScope.
Устройство важнее табличек с бенчмарками. Это MoE: всего 125 млрд параметров, но на каждый токен включаются только 6 млрд. Плюс отдельный слой N-gram эмбеддингов на 51 млрд, который живёт в системной оперативке, а не в видеопамяти.
Отсюда и вся экономика:
🔅 Обучение обошлось примерно в девять раз дешевле, чем предыдущий Qwen3.7-Plus — и при этом результат выше
🔅 В облаке Qwen стоит $0.16 за миллион входных и $0.47 за выходных. Это примерно в двенадцать раз дешевле их же флагмана
🔅 Контекст 262 144 токена нативно, до миллиона растягивается через YaRN
По заявленным замерам обгоняет Claude Opus 4.6 Max: SWE-bench Pro 62.5 против 53.4, многоязычный SWE-bench 81.0 против 77.5, CoWorkBench 73.9 против 68.2. На JobBench разрыв неприличный — 55.7 против 36.6.
Тут нужна оговорка: это замеры самого вендора. Ни одна лаборатория не публикует бенчмарк, где она проиграла. Ждём независимых прогонов, а до тех пор держим цифры как заявку, а не как факт.
Что здесь действительно имеет значение для бизнеса
Не место в рейтинге, а сочетание: открытые веса плюс шесть миллиардов активных параметров. Это значит, что модель такого класса реально поставить на своё железо — и данные никуда не уйдут. Год назад за подобное качество надо было платить за API и отдавать наружу каждый документ.
Схема с эмбеддингами в системной памяти намекает, куда идёт дело: часть модели выносится с дорогой видеопамяти на дешёвую оперативку. Для локальных развёртываний это интереснее любого рекорда в таблице.
P.S. 💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #нейросети #qwen
Alibaba выложила Qwen3.8-Flash-Next. Веса открыты, лицензия Apache 2.0, забирать с Hugging Face и ModelScope.
Устройство важнее табличек с бенчмарками. Это MoE: всего 125 млрд параметров, но на каждый токен включаются только 6 млрд. Плюс отдельный слой N-gram эмбеддингов на 51 млрд, который живёт в системной оперативке, а не в видеопамяти.
Отсюда и вся экономика:
🔅 Обучение обошлось примерно в девять раз дешевле, чем предыдущий Qwen3.7-Plus — и при этом результат выше
🔅 В облаке Qwen стоит $0.16 за миллион входных и $0.47 за выходных. Это примерно в двенадцать раз дешевле их же флагмана
🔅 Контекст 262 144 токена нативно, до миллиона растягивается через YaRN
По заявленным замерам обгоняет Claude Opus 4.6 Max: SWE-bench Pro 62.5 против 53.4, многоязычный SWE-bench 81.0 против 77.5, CoWorkBench 73.9 против 68.2. На JobBench разрыв неприличный — 55.7 против 36.6.
Тут нужна оговорка: это замеры самого вендора. Ни одна лаборатория не публикует бенчмарк, где она проиграла. Ждём независимых прогонов, а до тех пор держим цифры как заявку, а не как факт.
Что здесь действительно имеет значение для бизнеса
Не место в рейтинге, а сочетание: открытые веса плюс шесть миллиардов активных параметров. Это значит, что модель такого класса реально поставить на своё железо — и данные никуда не уйдут. Год назад за подобное качество надо было платить за API и отдавать наружу каждый документ.
Схема с эмбеддингами в системной памяти намекает, куда идёт дело: часть модели выносится с дорогой видеопамяти на дешёвую оперативку. Для локальных развёртываний это интереснее любого рекорда в таблице.
P.S. 💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #нейросети #qwen