Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: inference
Непрерывная группировка и предзаполнение по блокам в vLLM и SGLang
Статические пакеты LLM тратят ресурсы GPU на заполнение ненужными данными. Планирование на уровне итераций и пошаговое предзаполнение обеспечивают плавную работу потоков декодирования, позволяя новым запросам продолжать обрабатываться.
1144 словЧитатьОптимизация инференса LLM: предзаполнение, декодирование и корпоративные инструменты LLMOps
Проблемы заполнения предварительных данных и декодирования, непрерывная группировка данных, FlashAttention, квантизация, PagedAttention, спекулятивное декодирование, разбитое заполнение предварительных данных и децентрализованная обработка запросов.
1809 словЧитатьПочему загрузка модели объемом 17 ГБ не означает наличия 17 ГБ памяти для ее работы
Узнайте, как активные параметры, общее количество параметров, рост размера кэша KV и усилия по обработке информации определяют реальные затраты на память и вычисления при работе с языковой моделью локально.
2722 словЧитатьКогда этапы квантизации вызывают плексис и тайно нарушают безопасность модели
Квантизация кэша KV с низким количеством битов может устранить эффект отказа модели, при этом показатель перплекситета почти не меняется; вот почему стандартные метрики этого не фиксируют и что следует добавить в ваш механизм управления.
1625 словЧитать
О этих статьях
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.