Artykuły dla tych, którzy
wdrażają stack
Oryginalne materiały o React, Node.js, TypeScript i AI — z tej samej praktyki co nasze oprogramowanie operatorskie. Treść artykułów po angielsku.
Tag: gpu
Ciągłe grupowanie i przedwczesne wypełnianie w partiach w vLLM i SGLang
Statyczne grupy LLM marnują zasoby GPU na wypełnianie danych. Planowanie na poziomie iteracji oraz przedwczesne wypełnianie w blokach zapewniają płynny przepływ dekodowania, nawet gdy nowe polecenia są jeszcze przetwarzane.
1144 słówCzytajOptymalizacja inferencji LLM: prefill, dekodowanie oraz enterprise LLMOps
Wąskie gardła związane z wypełnianiem uprzednim a dekodowaniem, ciągłe grupowanie danych, FlashAttention, kwantyzacja, PagedAttention, dekodowanie spekulatywne, wypełnianie uprzednie w fragmentach oraz serwisowanie rozproszone.
1809 słówCzytajUruchamianie Qwen3.8-27B na jednym RTX 3090 z poprawionym vLLM i DFlash2
Jak przymocowana gałąź vLLM 0.28.0 z rekwantyzowanymi embeddingami i technologią DFlash2 umożliwia uruchomienie hybrydowego modelu o wielkości 27 miliardów parametrów na karcie pamięci o pojemności 24 GB, oraz dlaczego długi kontekst spowalnia jego działanie.
3193 słówCzytajDostępna wersja Qwen3.8-Flash-Next na kartach RTX 3090 z użyciem mechanizmu offloadingu tensorów w llama.cpp
Dlaczego model rzadki o pojemności 88 GB i 180 miliardów parametrów pasuje do kart graficznych konsumenckich, oraz w jaki sposób flagi takie jak -ot, -ncmoe i mmap w llama.cpp rozkładają jego zasoby pomiędzy VRAM, RAM i NVMe.
2691 słówCzytaj
O tych artykułach
Wycena w 24 h
Potrzebujesz tego stacka w warstwie operatorskiej? Wyślij brief — wycena w 24 h.