Артыкулы для тых, хто
выводзіць стэк у прод
Арыгінальныя матэрыялы пра React, Node.js, TypeScript і AI — з той жа практыкі, што і наша аператарскае ПЗ. Тэкст артыкулаў па-англійску.
Тэг: inference
Адыяктна групаванне дадзеных і часткова прадзейнаванне ў vLLM і SGLang
Статычныя пакеты LLM марнаваюць ресурсы GPU на дадзенняя-падставы. Раскладка па кроках і частковая падготавка дадзенняя дапамагаюць зберагчы павольны працэўнік декодавання, калі новыя запиты ўсё яшчэ працуюць.
1144 слоўЧытацьОптымізацыя вычысленняў LLM: падзаполненне, декодаванне і корпоратыўскія методы керування LLM.
Проблемы прадзяўлення проты расшыфравання, непаўзлівая групаванне даных, FlashAttention, квантызацыя, PagedAttention, спекуляatyвае расшыфравання, прадзяўленне па часткам і роздзельная аператываўная обработка.
1809 слоўЧытацьЧаму завантажэнне модэля ў розмяре 17 ГБ не означае, што для його роботы патрэбна 17 ГБ памяці.
Дазвольце даклэ научыцца, як актыўныя параметры, загальныя параметры, зростанне KV-кэша і зусілля для аналізу вплываюць на рэальныя витраты на память і вычыслення пад час роботы мовнага модэля локальна.
2722 слоўЧытацьКалі час перакантэнзацыя падвышае пэрплексітэт і таямні наражае на абяранне модэлю
Квантыяцыя кэша KV з нізкім коллекшанам бітоў можа усунуць адмовы модэлю, пры чым парапсіцыя практычна не зменяецца; гэтаму стандартныя метрыкі яго не фіксуюць, і што трэба дадаць у вашу систему кантролю.
1625 слоўЧытаць
Пра гэтыя артыкулы
Ацэнка за 24 гадзіны
Патрэбны такі стэк у аператарскім слоі? Дашліце брыф — ацэнка за 24 гадзіны.