Инженерные заметки
Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: llama.cpp
Работа с Qwen3.8-Flash-Next на картах RTX 3090 с использованием технологии откладки вычислений Tensor в llama.cpp
Почему разреженная модель объемом 88 ГБ с 180 миллиардами параметров помещается в графические процессоры для потребителей, и как такие флаги в llama.cpp, как -ot, -ncmoe и mmap, распределяют ее между VRAM, RAM и NVMe.
2691 словЧитать
FAQ
О этих статьях
Да. Каждый текст — оригинальный английский рерайт для этого сайта. Структура и код следуют источнику; проза переписана и проверена на пересечения.
Технические посты сначала на английском, чтобы код и API оставались точными. Оболочка сайта доступна на всех девяти языках.
Новые черновики попадают в очередь после редактуры. Импорт на сайт берёт только новые или изменённые slug — без дублей.
Примеры иллюстративные. Проверяйте стек и лицензии перед продом. Для внедрения пришлите бриф.
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.