Артыкулы для тых, хто
выводзіць стэк у прод
Арыгінальныя матэрыялы пра React, Node.js, TypeScript і AI — з той жа практыкі, што і наша аператарскае ПЗ. Тэкст артыкулаў па-англійску.
Тэг: gpu
Адыяктна групаванне дадзеных і часткова прадзейнаванне ў vLLM і SGLang
Статычныя пакеты LLM марнаваюць ресурсы GPU на дадзенняя-падставы. Раскладка па кроках і частковая падготавка дадзенняя дапамагаюць зберагчы павольны працэўнік декодавання, калі новыя запиты ўсё яшчэ працуюць.
1144 слоўЧытацьОптымізацыя вычысленняў LLM: падзаполненне, декодаванне і корпоратыўскія методы керування LLM.
Проблемы прадзяўлення проты расшыфравання, непаўзлівая групаванне даных, FlashAttention, квантызацыя, PagedAttention, спекуляatyвае расшыфравання, прадзяўленне па часткам і роздзельная аператываўная обработка.
1809 слоўЧытацьВыкананне Qwen3.8-27B на адзінам RTX 3090 з падправленым vLLM і DFlash2
Як форк vLLM 0.28.0 з закрепленым варыянтом, які выкарыстоўвае реквантазаваныя эмбеддінгі та тэхналогію DFlash2, дазволяе запрацоўваць гібрыдны модель размерам 27 мільярда параметраў на карцы памяці ў 24 ГБ, і чаму дзейство з дужа дзьвінгай кантэкстам уповольняе його працэс.
3193 слоўЧытацьВыкананне Qwen3.8-Flash-Next на картаках RTX 3090 з адпыткамі Tensor Offloading ад llama.cpp
Чаму рыхлы модель па 88 ГБ з 180 мільярда параметраў падходзіць для спожывачскіх GPU, і як такі флагі ля llama.cpp, як -ot, -ncmoe і mmap, дзельнуюць яе межаў VRAM, RAM і NVMe.
2691 слоўЧытаць
Пра гэтыя артыкулы
Ацэнка за 24 гадзіны
Патрэбны такі стэк у аператарскім слоі? Дашліце брыф — ацэнка за 24 гадзіны.