Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: gpu
Непрерывная группировка и предзаполнение по блокам в vLLM и SGLang
Статические пакеты LLM тратят ресурсы GPU на заполнение ненужными данными. Планирование на уровне итераций и пошаговое предзаполнение обеспечивают плавную работу потоков декодирования, позволяя новым запросам продолжать обрабатываться.
1144 словЧитатьОптимизация инференса LLM: предзаполнение, декодирование и корпоративные инструменты LLMOps
Проблемы заполнения предварительных данных и декодирования, непрерывная группировка данных, FlashAttention, квантизация, PagedAttention, спекулятивное декодирование, разбитое заполнение предварительных данных и децентрализованная обработка запросов.
1809 словЧитатьЗапуск Qwen3.8-27B на одной карте RTX 3090 с обновленным vLLM и DFlash2
Как форк vLLM 0.28.0 с фиксированным состоянием, использующий реквантизированные эмбеддинги и технологию DFlash2 для спекулятивных вычислений, позволяет запускать гибридную модель объемом 27 миллиардов параметров на карте с памятью 24 ГБ, и почему длинный контекст замедляет ее работу.
3193 словЧитатьРабота с Qwen3.8-Flash-Next на картах RTX 3090 с использованием технологии откладки вычислений Tensor в llama.cpp
Почему разреженная модель объемом 88 ГБ с 180 миллиардами параметров помещается в графические процессоры для потребителей, и как такие флаги в llama.cpp, как -ot, -ncmoe и mmap, распределяют ее между VRAM, RAM и NVMe.
2691 словЧитать
О этих статьях
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.