Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: vllm
Непрерывная группировка и предзаполнение по блокам в vLLM и SGLang
Статические пакеты LLM тратят ресурсы GPU на заполнение ненужными данными. Планирование на уровне итераций и пошаговое предзаполнение обеспечивают плавную работу потоков декодирования, позволяя новым запросам продолжать обрабатываться.
1144 словЧитатьОптимизация инференса LLM: предзаполнение, декодирование и корпоративные инструменты LLMOps
Проблемы заполнения предварительных данных и декодирования, непрерывная группировка данных, FlashAttention, квантизация, PagedAttention, спекулятивное декодирование, разбитое заполнение предварительных данных и децентрализованная обработка запросов.
1809 словЧитатьLLMOps для небольших языковых моделей: фреймворки обслуживания и руководства по внедрению в производство
Почему SLMs превосходят по стоимости и уровню конфиденциальности, как сравниваются vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX и TensorRT-LLM, а также как квантизировать их, оценивать и использовать в производственных условиях.
4127 словЧитатьЗапуск Qwen3.8-27B на одной карте RTX 3090 с обновленным vLLM и DFlash2
Как форк vLLM 0.28.0 с фиксированным состоянием, использующий реквантизированные эмбеддинги и технологию DFlash2 для спекулятивных вычислений, позволяет запускать гибридную модель объемом 27 миллиардов параметров на карте с памятью 24 ГБ, и почему длинный контекст замедляет ее работу.
3193 словЧитать
О этих статьях
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.