Artikel für Leute, die
den Stack ausliefern
Originale Beiträge zu React, Node.js, TypeScript und AI — aus derselben Praxis wie unsere Operator-Software. Artikeltexte auf Englisch.
Tag: llmops
Kontinuierliches Batchen und in Blöcken vorgefüllte Daten in vLLM und SGLang
Statische LLM-Batches verschwenden GPU-Ressourcen durch Paddings. Iterationsbasierte Scheduling-Strategien sowie in Blöcken vorbereitete Daten sorgen dafür, dass die Dekodierströme reibungslos verlaufen, während neue Anfragen weiterhin Fortschritte erzielen.
1144 WörterArtikel lesenOptimierung der LLM-Inferenz: Vorausfüllen, Dekodieren und enterprise-geeignete LLMOps
Vorvollfüllung gegenüber Dekodierungsengpässen, kontinuierliches Batching, FlashAttention, Quantisierung, PagedAttention, spekulatives Dekodieren, in Blöcken erfolgende Vorvollfüllung sowie deaggregierte Bereitstellung.
1809 WörterArtikel lesenUnternehmenskI-Architektur: RAG findet, LLMs denken, Entscheidungsmodelle wählen
Warum Recherche und sprachliches Reasoning nicht ausreichen – wie GraphRAG, Agenten sowie System-1-Entscheidungsmodelle wie Jev Wissen, Kontext, Reasoning, Entscheidungsfindung und Ausführung voneinander trennen.
2111 WörterArtikel lesenLLMOps für kleine Sprachmodelle: Servierungsframeworks und Produktionsleitfäden
Warum SLMs bei Kosten und Privatsphäre gewinnen, wie sich vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX und TensorRT-LLM vergleichen lassen, sowie wie man sie in der Produktion quantifiziert, bewertet und einsetzt.
4127 WörterArtikel lesen
Über diese Artikel
Angebot in 24 Stunden
Denselben Stack in einer Operator-Schicht? Brief schicken — Angebot in 24 Stunden.