MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Python/ django

8 Oct, 13:53

Открыть в Max Поделиться

Baseten выпустила бесплатный учебник по инженерии инференса

Платформа, которая хостит модели Cursor, Notion и Harvey, выложила https://www.baseten.co/inference-engineering/)' rel='nofollow' target='_blank'>(https://www.baseten.co/inference-engineering/)' rel='nofollow' target='_blank'>https://www.baseten.co/inference-engineering/)
 в открытый доступ книгу Inference Engineering за авторством Филипа Кайли. который четыре года работает в Baseten и написал её по интервью с инженерами компании и собственным докладам.

Среди рецензентов - автор FlashAttention Три Дао.

Книга собирает в одном месте путь от выбора модели и GPU до мониторинга работающего сервиса.

Baseten основана в 2019 году тремя выходцами из Gumroad, четвёртым сооснователем стал Панкадж Гупта из Uber.

Компания продаёт выделенные развёртывания открытых и собственных моделей клиентов, готовые Model APIs и инфраструктуру для дообучения, а также развивает открытый фреймворк упаковки моделей Truss.

Восемь глав объясняют, как сформулировать требования к продукту, как устроены модели и где они тормозят, прежде всего в механизме внимания, разбирают GPU NVIDIA поколений Hopper и Blackwell и программный уровень, от CUDA и PyTorch до движков vLLM, SGLang, TensorRT-LLM и Dynamo.

Отдельные главы посвящены методам ускорения, моделям для речи, изображений и видео, а также эксплуатации - от автомасштабирования и батчинга до постепенной выкатки новых версий.

Новичку книга даёт карту области и порядок действий - как определить задачу, бюджет задержки, стоимости и подобрать модель, а в последующем заняться оптимизацией.

Базовые понятия вроде предзаполнения, декодирования и KV-кэша объяснены с нуля, а незнакомые термины можно найти в глоссарии.

Опытным инженерам будут интересны пороги и практические правила. Для каждой техники ускорения автор объясняет, как она устроена, при каком трафике и размере модели окупается и чем рискует качество ответов.

Отдельно сравниваются движки инференса и разобраны задачи эксплуатации, которые обычно приходится решать методом проб и ошибок.

Последний раздел посвящён продуктам компании, а оборудование рассматривается почти целиком на примере NVIDIA, другим ускорителям отведено около двух страниц.

🔜 Запросить книгу бесплатно в форматах PDF, EPUB или https://www.baseten.co/inference-engineering/digital-download/)' rel='nofollow' target='_blank'>аудиоверсию (https://www.baseten.co/inference-engineering/digital-download/)' rel='nofollow' target='_blank'>https://www.baseten.co/inference-engineering/digital-download/)


#AI #ML #Inference #Book #Baseten

327 4
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat