Artikel für Leute, die
den Stack ausliefern
Originale Beiträge zu React, Node.js, TypeScript und AI — aus derselben Praxis wie unsere Operator-Software. Artikeltexte auf Englisch.
Tag: gpu
Kontinuierliches Batchen und in Blöcken vorgefüllte Daten in vLLM und SGLang
Statische LLM-Batches verschwenden GPU-Ressourcen durch Paddings. Iterationsbasierte Scheduling-Strategien sowie in Blöcken vorbereitete Daten sorgen dafür, dass die Dekodierströme reibungslos verlaufen, während neue Anfragen weiterhin Fortschritte erzielen.
1144 WörterArtikel lesenOptimierung der LLM-Inferenz: Vorausfüllen, Dekodieren und enterprise-geeignete LLMOps
Vorvollfüllung gegenüber Dekodierungsengpässen, kontinuierliches Batching, FlashAttention, Quantisierung, PagedAttention, spekulatives Dekodieren, in Blöcken erfolgende Vorvollfüllung sowie deaggregierte Bereitstellung.
1809 WörterArtikel lesenQwen3.8-27B wird auf einer RTX 3090 mit einem gepatchten vLLM und DFlash2 ausgeführt.
Wie ein gepinnter vLLM 0,28,0-Branch mit neu quantisierten Embeddings und DFlash2-Spekulationen ein 27-Billionen-Modell auf einer Karte mit 24 GB ausführt – und wo ein langer Kontext die Leistung verlangsamt.
3193 WörterArtikel lesenQwen3.8-Flash-Next unter Verwendung von RTX 3090-Grafikkarten mit Tensor-Offloading über llama.cpp
Warum ein 88 GB großes, sparsames Modell mit 180 Milliarden Parametern auf Consumer-GPUs passt und wie Flags wie -ot, -ncmoe sowie mmap von llama.cpp es auf VRAM, RAM und NVMe aufteilen.
2691 WörterArtikel lesen
Über diese Artikel
Angebot in 24 Stunden
Denselben Stack in einer Operator-Schicht? Brief schicken — Angebot in 24 Stunden.