Инженерные заметки
Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: Mixture of Experts
Работа с Qwen3.8-Flash-Next на картах RTX 3090 с использованием технологии откладки вычислений Tensor в llama.cpp
Почему разреженная модель объемом 88 ГБ с 180 миллиардами параметров помещается в графические процессоры для потребителей, и как такие флаги в llama.cpp, как -ot, -ncmoe и mmap, распределяют ее между VRAM, RAM и NVMe.
2691 словЧитатьПочему загрузка модели объемом 17 ГБ не означает наличия 17 ГБ памяти для ее работы
Узнайте, как активные параметры, общее количество параметров, рост размера кэша KV и усилия по обработке информации определяют реальные затраты на память и вычисления при работе с языковой моделью локально.
2722 словЧитать
FAQ
О этих статьях
Да. Каждый текст — оригинальный английский рерайт для этого сайта. Структура и код следуют источнику; проза переписана и проверена на пересечения.
Технические посты сначала на английском, чтобы код и API оставались точными. Оболочка сайта доступна на всех девяти языках.
Новые черновики попадают в очередь после редактуры. Импорт на сайт берёт только новые или изменённые slug — без дублей.
Примеры иллюстративные. Проверяйте стек и лицензии перед продом. Для внедрения пришлите бриф.
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.