Artikel für Leute, die
den Stack ausliefern
Originale Beiträge zu React, Node.js, TypeScript und AI — aus derselben Praxis wie unsere Operator-Software. Artikeltexte auf Englisch.
Tag: inference
Kontinuierliches Batchen und in Blöcken vorgefüllte Daten in vLLM und SGLang
Statische LLM-Batches verschwenden GPU-Ressourcen durch Paddings. Iterationsbasierte Scheduling-Strategien sowie in Blöcken vorbereitete Daten sorgen dafür, dass die Dekodierströme reibungslos verlaufen, während neue Anfragen weiterhin Fortschritte erzielen.
1144 WörterArtikel lesenOptimierung der LLM-Inferenz: Vorausfüllen, Dekodieren und enterprise-geeignete LLMOps
Vorvollfüllung gegenüber Dekodierungsengpässen, kontinuierliches Batching, FlashAttention, Quantisierung, PagedAttention, spekulatives Dekodieren, in Blöcken erfolgende Vorvollfüllung sowie deaggregierte Bereitstellung.
1809 WörterArtikel lesenWarum ein 17-GB-Modell, das heruntergeladen wird, nicht bedeutet, dass 17 GB Speicher zum Betrieb benötigt werden
Erfahren Sie, wie aktive Parameter, Gesamtparameter, das Wachstum des KV-Caches sowie die Rechenaufwand die tatsächlichen Speicher- und Rechenkosten für den lokalen Betrieb eines Sprachmodells bestimmen.
2722 WörterArtikel lesenWenn die Quantisierungsphasen die Verwirrung erhöhen und heimlich die Sicherheit des Modells gefährden
Die Quantisierung des Low-Bit KV-Caches kann die Ablehnungsrate eines Modells beseitigen, während sich die Perplexität kaum verändert; hier ist der Grund, warum die Standardmetriken dies übersehen, und was Sie zu Ihren Gate-Funktionen hinzufügen sollten.
1625 WörterArtikel lesen
Über diese Artikel
Angebot in 24 Stunden
Denselben Stack in einer Operator-Schicht? Brief schicken — Angebot in 24 Stunden.