Видео недоступно для предпросмотра
Смотреть в Max
На демо LLM-инференс может работать быстро, а под реальной нагрузкой — получить растущий p99, очередь запросов и внезапный OOM.
Причем проблемы проявляются не сразу: когда p99 уже начинает расти, средняя задержка еще может быть нормальной.
В статье разбираем четыре механизма такой деградации:
🌟 фрагментация KV-cache
🌟 нехватка памяти на длинном контексте
🌟 блокировка очереди при батчинге
🌟 разрыв между p50 и p99.
👀 Главное — этот процесс можно заметить заранее. Средней задержки для этого мало. Нужны gpu_cache_usage, p99 задержки между токенами, глубина очереди, счетчик вытеснений и preemption.
Отдельно показываем, как подобрать параметры батчинга под свой трафик и почему оптимизации вроде PagedAttention не отменяют наблюдения за памятью и хвостовыми задержками.
В статье есть примеры расчетов для разных контекстов и скрипты для проверки KV-кэш, OOM, батчинга и хвостовой латентности на собственной инфраструктуре.
👉 Читайте на Хабре
Причем проблемы проявляются не сразу: когда p99 уже начинает расти, средняя задержка еще может быть нормальной.
В статье разбираем четыре механизма такой деградации:
🌟 фрагментация KV-cache
🌟 нехватка памяти на длинном контексте
🌟 блокировка очереди при батчинге
🌟 разрыв между p50 и p99.
👀 Главное — этот процесс можно заметить заранее. Средней задержки для этого мало. Нужны gpu_cache_usage, p99 задержки между токенами, глубина очереди, счетчик вытеснений и preemption.
Отдельно показываем, как подобрать параметры батчинга под свой трафик и почему оптимизации вроде PagedAttention не отменяют наблюдения за памятью и хвостовыми задержками.
В статье есть примеры расчетов для разных контекстов и скрипты для проверки KV-кэш, OOM, батчинга и хвостовой латентности на собственной инфраструктуре.
👉 Читайте на Хабре