Des articles pour ceux qui
livrent le stack
Textes originaux sur React, Node.js, TypeScript et AI — issus de la même pratique que notre logiciel opérateur. Corps des articles en anglais.
Tag : gpu
Grouper les données de manière continue et préremplir par blocs dans vLLM et SGLang
Les lots statiques de LLM gaspillent les GPU en raison du remplissage inutile. Un planification au niveau des itérations et un préremplissage par blocs permettent de maintenir des flux de décodage fluides tout en assurant que les nouveaux prompts progressent également.
1144 motsLireOptimisation de l’inférence des LLM : préremplissage, décodage et LLMOps d’entreprise
Goulets d’étranglement liés au préremplissage et à la décodage, lotification continue, FlashAttention, quantification, PagedAttention, décodage spéculatif, préremplissage par blocs et fourniture désagrégée.
1809 motsLireExécuter Qwen3.8-27B sur une seule carte RTX 3090, avec vLLM mis à jour et DFlash2.
Comment une branche de vLLM 0.28.0 verrouillée, avec des embeddings réquantifiés et la spéculation DFlash2, permet de faire fonctionner un modèle hybride de 27 milliards de paramètres sur une carte de 24 Go, et en quoi un contexte trop long ralentit son fonctionnement.
3193 motsLireFonctionne avec Qwen3.8-Flash-Next sur des RTX 3090 grâce au chargement délégué des tenseurs de llama.cpp
Pourquoi un modèle épars de 88 Go et de 180 milliards de paramètres peut fonctionner sur des GPU grand public, et comment des options comme -ot, -ncmoe et mmap de llama.cpp le répartissent sur la VRAM, la RAM et NVMe.
2691 motsLire
À propos de ces articles
Devis en 24 h
Besoin du même stack en couche opérateur ? Envoyez le brief — devis sous 24 h.