Notatki inżynierskie
Artykuły dla tych, którzy
wdrażają stack
Oryginalne materiały o React, Node.js, TypeScript i AI — z tej samej praktyki co nasze oprogramowanie operatorskie. Treść artykułów po angielsku.
Tag: kv-cache
Pamięć KV to niewidzialna baza danych, która zużywa pamięć GPU podczas dekodowania modeli LLM.
Wypełnianie z góry versus dekodowanie, matematyka KV, GQA/MQA, PagedAttention, kwantyzacja oraz usuwanie elementów w celu wykonywania inferyencji w produkcji.
2068 słówCzytajInferencja LLM od początku do końca: prefill, decode, cache KV i próbkowanie
Przewodnik przygotowany do prezentacji na tablicy białej po tokenizatorze w kontekście przepływu danych – dlaczego prefill jest ograniczony zasobami obliczeniowymi, decode – przepustowością, oraz jak GQA, pagowanie i spekulacja wpływają na efektywność.
9177 słówCzytaj
FAQ
O tych artykułach
Tak. Każdy tekst to oryginalny angielski rewrite na tę stronę. Struktura i kod za źródłem; proza przepisana i sprawdzona pod kątem pokrycia.
Posty techniczne najpierw po angielsku, by kod i API były dokładne. Interfejs strony jest w dziewięciu językach.
Nowe drafty trafiają do kolejki po redakcji. Import na stronę bierze tylko nowe lub zmienione slugi — bez duplikatów.
Przykłady są ilustracyjne. Sprawdź stack i licencje przed produkcją. W sprawie wdrożenia wyślij brief.
Wycena w 24 h
Potrzebujesz tego stacka w warstwie operatorskiej? Wyślij brief — wycena w 24 h.