Engineering-Notizen
Artikel für Leute, die
den Stack ausliefern
Originale Beiträge zu React, Node.js, TypeScript und AI — aus derselben Praxis wie unsere Operator-Software. Artikeltexte auf Englisch.
Tag: kv-cache
Der KV-Cache ist die unsichtbare Datenbank, die im Decodieren von LLMs GPU-Speicher verbraucht.
Vorbefüllen versus Dekodieren, KV-Mathematik, GQA/MQA, PagedAttention, Quantisierung sowie Ausschließung für die Produktionseinbettung.
2068 WörterArtikel lesenEnd-to-End-Inferenz von LLMs: Vorausbefüllung, Dekodierung, KV-Cache und Stichprobenziehung
Eine für Whiteboards geeignete Einführung in den Tokenisierungsprozess im Streaming – warum die Vorausbefüllung durch Rechenleistung begrenzt ist, die Dekodierung durch Bandbreite und wie GQA, Paginieren sowie Spekulationen die Kostenstruktur verändern.
9177 WörterArtikel lesen
FAQ
Über diese Artikel
Ja. Jeder Text ist ein originales englisches Rewrite für diese Site. Struktur und Code folgen der Quelle; Prosa wird neu geschrieben und auf Überlappung geprüft.
Technische Posts zuerst auf Englisch, damit Code und APIs exakt bleiben. Die Site-Chrome gibt es in allen neun Sprachen.
Neue Entwürfe kommen nach der Redaktion in die Queue. Der Site-Import nimmt nur neue oder geänderte Slugs — ohne Duplikate.
Beispiele sind illustrativ. Prüfen Sie Stack und Lizenzen vor Produktion. Für Umsetzung den Brief senden.
Angebot in 24 Stunden
Denselben Stack in einer Operator-Schicht? Brief schicken — Angebot in 24 Stunden.