Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: inference
Постійне групування та часткове попереднє заповнення у vLLM та SGLang
Статичні пакети LLM марнують ресурси GPU на додаткові дані. Розкладання операцій на рівні ітерацій та часткове попереднє заповнення забезпечують плавний потік декодування, навіть коли нові запити все ще обробляються.
1144 слівЧитатиОптимізація інференсу LLM: попереднє заповнення, декодування та корпоративні LLMOps
Проблеми заповнення попередніми даними та декодування, безперервне групування даних, FlashAttention, квантація, PagedAttention, спекулятивне декодування, часткове заповнення попередніми даними та роз’єднане надання послуг.
1809 слівЧитатиЧому завантаження моделі розміром 17 ГБ не означає, що для її роботи потрібно 17 ГБ пам’яті
Дізнайтеся, як активні параметри, загальна кількість параметрів, зростання кешу KV та зусилля для міркувань визначають реальну вартість пам’яті та обчислень для роботи мовної моделі локально.
2722 слівЧитатиКоли етапи квантування спричиняють плутанину та тихо порушують безпеку моделі
Квантація кешу KV з низькою кількістю бітів може усунути ефект відмов моделі, при цьому показник перплекситету майже не змінюється; ось чому стандартні метрики це не фіксують та що слід додати до вашого механізму керування.
1625 слівЧитати
Про ці статті
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.