Des articles pour ceux qui
livrent le stack
Textes originaux sur React, Node.js, TypeScript et AI — issus de la même pratique que notre logiciel opérateur. Corps des articles en anglais.
Tag : vllm
Grouper les données de manière continue et préremplir par blocs dans vLLM et SGLang
Les lots statiques de LLM gaspillent les GPU en raison du remplissage inutile. Un planification au niveau des itérations et un préremplissage par blocs permettent de maintenir des flux de décodage fluides tout en assurant que les nouveaux prompts progressent également.
1144 motsLireOptimisation de l’inférence des LLM : préremplissage, décodage et LLMOps d’entreprise
Goulets d’étranglement liés au préremplissage et à la décodage, lotification continue, FlashAttention, quantification, PagedAttention, décodage spéculatif, préremplissage par blocs et fourniture désagrégée.
1809 motsLireLLMOps pour les petits modèles de langage : frameworks de déploiement et guides de mise en production
Pourquoi les SLM l’emportent en termes de coût et de confidentialité, comment se comparent vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX et TensorRT-LLM, ainsi que comment les quantifier, les évaluer et les intégrer en environnement de production.
4127 motsLireExécuter Qwen3.8-27B sur une seule carte RTX 3090, avec vLLM mis à jour et DFlash2.
Comment une branche de vLLM 0.28.0 verrouillée, avec des embeddings réquantifiés et la spéculation DFlash2, permet de faire fonctionner un modèle hybride de 27 milliards de paramètres sur une carte de 24 Go, et en quoi un contexte trop long ralentit son fonctionnement.
3193 motsLire
À propos de ces articles
Devis en 24 h
Besoin du même stack en couche opérateur ? Envoyez le brief — devis sous 24 h.