Инженерные заметки
Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: kv-cache
Кэш KV — это невидимая база данных, которая истощает память GPU во время декодирования LLM.
Заполнение заранее против декодирования, математика KV-парами, GQA/MQA, PagedAttention, квантизация и вытеснение для инференса в производстве.
2068 словЧитатьПолный процесс инференса LLM: предзаполнение, декодирование, кэш KV и выбор примеров
Обзор работы токенизатора в режиме потока с учетом особенностей использования на доске для записи — почему операция предзаполнения ограничена вычислительными ресурсами, а декодирование — пропускной способностью, и как механизмы GQA, пейджинга и спекуляции влияют на экономику процесса.
9177 словЧитать
FAQ
О этих статьях
Да. Каждый текст — оригинальный английский рерайт для этого сайта. Структура и код следуют источнику; проза переписана и проверена на пересечения.
Технические посты сначала на английском, чтобы код и API оставались точными. Оболочка сайта доступна на всех девяти языках.
Новые черновики попадают в очередь после редактуры. Импорт на сайт берёт только новые или изменённые slug — без дублей.
Примеры иллюстративные. Проверяйте стек и лицензии перед продом. Для внедрения пришлите бриф.
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.