Інженерні нотатки
Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: llama.cpp
Робота з Qwen3.8-Flash-Next на картках RTX 3090 за допомогою llama.cpp з відкладенням обчислень тензорів
Чому розріджена модель об’ємом 88 ГБ із 180 мільярдами параметрів підходить для споживчих GPU, та як такі параметри llama.cpp, як -ot, -ncmoe та mmap, розподіляють її між VRAM, RAM та NVMe.
2691 слівЧитати
FAQ
Про ці статті
Так. Кожен текст — оригінальний англійський рерайт для цього сайту. Структура й код за джерелом; прозу переписано й перевірено на збіги.
Технічні пости спочатку англійською, щоб код і API лишалися точними. Оболонка сайту — всіма девʼятьма мовами.
Нові чернетки потрапляють у чергу після редактури. Імпорт на сайт бере лише нові чи змінені slug — без дублів.
Приклади ілюстративні. Перевіряйте стек і ліцензії перед продом. Для впровадження надішліть бриф.
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.