Інженерні нотатки
Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: Mixture of Experts
Робота з Qwen3.8-Flash-Next на картках RTX 3090 за допомогою llama.cpp з відкладенням обчислень тензорів
Чому розріджена модель об’ємом 88 ГБ із 180 мільярдами параметрів підходить для споживчих GPU, та як такі параметри llama.cpp, як -ot, -ncmoe та mmap, розподіляють її між VRAM, RAM та NVMe.
2691 слівЧитатиЧому завантаження моделі розміром 17 ГБ не означає, що для її роботи потрібно 17 ГБ пам’яті
Дізнайтеся, як активні параметри, загальна кількість параметрів, зростання кешу KV та зусилля для міркувань визначають реальну вартість пам’яті та обчислень для роботи мовної моделі локально.
2722 слівЧитати
FAQ
Про ці статті
Так. Кожен текст — оригінальний англійський рерайт для цього сайту. Структура й код за джерелом; прозу переписано й перевірено на збіги.
Технічні пости спочатку англійською, щоб код і API лишалися точними. Оболонка сайту — всіма девʼятьма мовами.
Нові чернетки потрапляють у чергу після редактури. Імпорт на сайт бере лише нові чи змінені slug — без дублів.
Приклади ілюстративні. Перевіряйте стек і ліцензії перед продом. Для впровадження надішліть бриф.
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.