Ox Alpha раскрылась сама. Неделю мы бесплатно нагружали китайское железо
Загадка кончилась быстро. 26 августа Z.ai подтвердила: анонимная модель, которую с 20 августа все гоняли бесплатно на OpenRouter и OpenCode, — это GLM-5.3-Flash. В тот же день веса легли на Hugging Face под лицензией MIT.
Что за модель:
🔹 320 млрд параметров всего, активных на токен — 18 млрд. MoE
🔹 Первая нативно мультимодальная в линейке GLM-5: текст, изображения, видео, визуальные документы вперемешку
🔹 Контекст миллион токенов, веса в FP8
🔹 Цена примерно десятая часть от флагманской GLM-5.3
Теперь то, ради чего стоит дочитать.
Модель всю тестовую неделю работала целиком на китайских чипах — Ascend-класс от Huawei, без Nvidia. И держала порядка 100 триллионов токенов в сутки.
Вот это и есть новость, а не имя за псевдонимом. Год назад «китайское железо для инференса» звучало как заявление в пресс-релизе. Здесь его неделю проверяли тысячи разработчиков, не подозревая, что участвуют в нагрузочном тесте.
И заодно понятно, зачем была анонимность. Не маркетинг — бесплатный краудсорсинг обратной связи и стресс-тест инфраструктуры на живом трафике. Оплатили мы, промптами.
Что с этим делать. Веса открыты под MIT — модель можно поставить у себя, и вопрос «куда ушли данные» снимается. Через API она остаётся дешёвым вариантом для черновой работы, но помните: неделю ваши запросы шли анонимному провайдеру, и теперь известно, кому именно. Если в те дни вы кормили её клиентским кодом — это уже произошло.
Проверять железо под нагрузкой на чужих боевых задачах и не говорить об этом — приём, который стоит запомнить. Он ещё повторится, и не только у китайцев.
P.S. Обратите внимание на порядок: сначала неделя бесплатного стресс-теста, потом релиз. Не «выпустили и посмотрели», а «посмотрели и выпустили». Это дешевле и честнее по инженерии — но только если вы не тот, чьими промптами платили.
P.S. 💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #нейросети #selfhosted
Загадка кончилась быстро. 26 августа Z.ai подтвердила: анонимная модель, которую с 20 августа все гоняли бесплатно на OpenRouter и OpenCode, — это GLM-5.3-Flash. В тот же день веса легли на Hugging Face под лицензией MIT.
Что за модель:
🔹 320 млрд параметров всего, активных на токен — 18 млрд. MoE
🔹 Первая нативно мультимодальная в линейке GLM-5: текст, изображения, видео, визуальные документы вперемешку
🔹 Контекст миллион токенов, веса в FP8
🔹 Цена примерно десятая часть от флагманской GLM-5.3
Теперь то, ради чего стоит дочитать.
Модель всю тестовую неделю работала целиком на китайских чипах — Ascend-класс от Huawei, без Nvidia. И держала порядка 100 триллионов токенов в сутки.
Вот это и есть новость, а не имя за псевдонимом. Год назад «китайское железо для инференса» звучало как заявление в пресс-релизе. Здесь его неделю проверяли тысячи разработчиков, не подозревая, что участвуют в нагрузочном тесте.
И заодно понятно, зачем была анонимность. Не маркетинг — бесплатный краудсорсинг обратной связи и стресс-тест инфраструктуры на живом трафике. Оплатили мы, промптами.
Что с этим делать. Веса открыты под MIT — модель можно поставить у себя, и вопрос «куда ушли данные» снимается. Через API она остаётся дешёвым вариантом для черновой работы, но помните: неделю ваши запросы шли анонимному провайдеру, и теперь известно, кому именно. Если в те дни вы кормили её клиентским кодом — это уже произошло.
Проверять железо под нагрузкой на чужих боевых задачах и не говорить об этом — приём, который стоит запомнить. Он ещё повторится, и не только у китайцев.
P.S. Обратите внимание на порядок: сначала неделя бесплатного стресс-теста, потом релиз. Не «выпустили и посмотрели», а «посмотрели и выпустили». Это дешевле и честнее по инженерии — но только если вы не тот, чьими промптами платили.
P.S. 💬 Подпишитесь на Telegram, если хотите ещё больше пользы
#разбор #нейросети #selfhosted