MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Вокруг Kubernetes в VK

21 Aug, 15:29

Открыть в Max Поделиться

00:05
Видео недоступно для предпросмотра
Смотреть в Max
На демо LLM-инференс может работать быстро, а под реальной нагрузкой — получить растущий p99, очередь запросов и внезапный OOM.

Причем проблемы проявляются не сразу: когда p99 уже начинает расти, средняя задержка еще может быть нормальной.

В статье разбираем четыре механизма такой деградации:

🌟 фрагментация KV-cache
🌟 нехватка памяти на длинном контексте
🌟 блокировка очереди при батчинге
🌟 разрыв между p50 и p99.

👀 Главное — этот процесс можно заметить заранее. Средней задержки для этого мало. Нужны gpu_cache_usage, p99 задержки между токенами, глубина очереди, счетчик вытеснений и preemption.

Отдельно показываем, как подобрать параметры батчинга под свой трафик и почему оптимизации вроде PagedAttention не отменяют наблюдения за памятью и хвостовыми задержками.

В статье есть примеры расчетов для разных контекстов и скрипты для проверки KV-кэш, OOM, батчинга и хвостовой латентности на собственной инфраструктуре.

👉 Читайте на Хабре

97 3
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat