Інженерні нотатки
Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: kv-cache
Кеш KV — це невидима база даних, яка споживає пам’ять GPU під час декодування LLM.
Попереднє заповнення проти декодування, математика KV, GQA/MQA, PagedAttention, квантування та видалення для інференсу у продакшені.
2068 слівЧитатиКінцево-кінцеве інференсування LLM: попереднє заповнення, декодування, кеш KV та вибір зразків.
Огляд роботи токенайзера під час стрімування у форматі, придатному для використання на дошці запису — чому процес попереднього заповнення обмежений потужністю обчислювальних пристроїв, а декодування — пропускною здатністю каналу, та як GQA, пейджинг та спекуляція впливають на економіку процесу.
9177 слівЧитати
FAQ
Про ці статті
Так. Кожен текст — оригінальний англійський рерайт для цього сайту. Структура й код за джерелом; прозу переписано й перевірено на збіги.
Технічні пости спочатку англійською, щоб код і API лишалися точними. Оболонка сайту — всіма девʼятьма мовами.
Нові чернетки потрапляють у чергу після редактури. Імпорт на сайт бере лише нові чи змінені slug — без дублів.
Приклади ілюстративні. Перевіряйте стек і ліцензії перед продом. Для впровадження надішліть бриф.
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.