Артыкулы для тых, хто
выводзіць стэк у прод
Арыгінальныя матэрыялы пра React, Node.js, TypeScript і AI — з той жа практыкі, што і наша аператарскае ПЗ. Тэкст артыкулаў па-англійску.
Тэг: vllm
Адыяктна групаванне дадзеных і часткова прадзейнаванне ў vLLM і SGLang
Статычныя пакеты LLM марнаваюць ресурсы GPU на дадзенняя-падставы. Раскладка па кроках і частковая падготавка дадзенняя дапамагаюць зберагчы павольны працэўнік декодавання, калі новыя запиты ўсё яшчэ працуюць.
1144 слоўЧытацьОптымізацыя вычысленняў LLM: падзаполненне, декодаванне і корпоратыўскія методы керування LLM.
Проблемы прадзяўлення проты расшыфравання, непаўзлівая групаванне даных, FlashAttention, квантызацыя, PagedAttention, спекуляatyвае расшыфравання, прадзяўленне па часткам і роздзельная аператываўная обработка.
1809 слоўЧытацьLLMOps для малых мовных модэляў: фрэймворкі для аддачы і практычныя інструкцыі для працы ў працэсе вырабаткі
Чаму SLM-ы маюць прыямоўку ў каштоўнасці та прыватнасці, як поручваюцься vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX та TensorRT-LLM, і як квантавацыяваць, адмацаваць та выкарыстоўваць іх у практычным прыемлэнні.
4127 слоўЧытацьВыкананне Qwen3.8-27B на адзінам RTX 3090 з падправленым vLLM і DFlash2
Як форк vLLM 0.28.0 з закрепленым варыянтом, які выкарыстоўвае реквантазаваныя эмбеддінгі та тэхналогію DFlash2, дазволяе запрацоўваць гібрыдны модель размерам 27 мільярда параметраў на карцы памяці ў 24 ГБ, і чаму дзейство з дужа дзьвінгай кантэкстам уповольняе його працэс.
3193 слоўЧытаць
Пра гэтыя артыкулы
Ацэнка за 24 гадзіны
Патрэбны такі стэк у аператарскім слоі? Дашліце брыф — ацэнка за 24 гадзіны.