Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: vllm
Постійне групування та часткове попереднє заповнення у vLLM та SGLang
Статичні пакети LLM марнують ресурси GPU на додаткові дані. Розкладання операцій на рівні ітерацій та часткове попереднє заповнення забезпечують плавний потік декодування, навіть коли нові запити все ще обробляються.
1144 слівЧитатиОптимізація інференсу LLM: попереднє заповнення, декодування та корпоративні LLMOps
Проблеми заповнення попередніми даними та декодування, безперервне групування даних, FlashAttention, квантація, PagedAttention, спекулятивне декодування, часткове заповнення попередніми даними та роз’єднане надання послуг.
1809 слівЧитатиLLMOps для невеликих мовних моделей: фреймворки обслуговування та посібники з експлуатації в промислових умовах
Чому моделі SLM мають перевагу за ціною та приватністю, як порівнюються vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX та TensorRT-LLM, і як квантувати, оцінювати та використовувати їх у продакшені.
4127 слівЧитатиРобота з Qwen3.8-27B на одному RTX 3090 за допомогою виправленої версії vLLM та DFlash2
Як форк vLLM 0.28.0 із закріпленими версіями, реквантизованими ембеддингами та технологією DFlash2 дозволяє запускати 27-мільярдний гібридний модель на картці об’ємом 24 ГБ, та чому довгий контекст уповільнює його роботу.
3193 слівЧитати
Про ці статті
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.