Artikel für Leute, die
den Stack ausliefern
Originale Beiträge zu React, Node.js, TypeScript und AI — aus derselben Praxis wie unsere Operator-Software. Artikeltexte auf Englisch.
Tag: vllm
Kontinuierliches Batchen und in Blöcken vorgefüllte Daten in vLLM und SGLang
Statische LLM-Batches verschwenden GPU-Ressourcen durch Paddings. Iterationsbasierte Scheduling-Strategien sowie in Blöcken vorbereitete Daten sorgen dafür, dass die Dekodierströme reibungslos verlaufen, während neue Anfragen weiterhin Fortschritte erzielen.
1144 WörterArtikel lesenOptimierung der LLM-Inferenz: Vorausfüllen, Dekodieren und enterprise-geeignete LLMOps
Vorvollfüllung gegenüber Dekodierungsengpässen, kontinuierliches Batching, FlashAttention, Quantisierung, PagedAttention, spekulatives Dekodieren, in Blöcken erfolgende Vorvollfüllung sowie deaggregierte Bereitstellung.
1809 WörterArtikel lesenLLMOps für kleine Sprachmodelle: Servierungsframeworks und Produktionsleitfäden
Warum SLMs bei Kosten und Privatsphäre gewinnen, wie sich vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX und TensorRT-LLM vergleichen lassen, sowie wie man sie in der Produktion quantifiziert, bewertet und einsetzt.
4127 WörterArtikel lesenQwen3.8-27B wird auf einer RTX 3090 mit einem gepatchten vLLM und DFlash2 ausgeführt.
Wie ein gepinnter vLLM 0,28,0-Branch mit neu quantisierten Embeddings und DFlash2-Spekulationen ein 27-Billionen-Modell auf einer Karte mit 24 GB ausführt – und wo ein langer Kontext die Leistung verlangsamt.
3193 WörterArtikel lesen
Über diese Artikel
Angebot in 24 Stunden
Denselben Stack in einer Operator-Schicht? Brief schicken — Angebot in 24 Stunden.