Des articles pour ceux qui
livrent le stack
Textes originaux sur React, Node.js, TypeScript et AI — issus de la même pratique que notre logiciel opérateur. Corps des articles en anglais.
Tag : inference
Grouper les données de manière continue et préremplir par blocs dans vLLM et SGLang
Les lots statiques de LLM gaspillent les GPU en raison du remplissage inutile. Un planification au niveau des itérations et un préremplissage par blocs permettent de maintenir des flux de décodage fluides tout en assurant que les nouveaux prompts progressent également.
1144 motsLireOptimisation de l’inférence des LLM : préremplissage, décodage et LLMOps d’entreprise
Goulets d’étranglement liés au préremplissage et à la décodage, lotification continue, FlashAttention, quantification, PagedAttention, décodage spéculatif, préremplissage par blocs et fourniture désagrégée.
1809 motsLirePourquoi un téléchargement du modèle de 17 Go ne signifie pas 17 Go de mémoire pour le faire fonctionner
Découvrez comment les paramètres actifs, le nombre total de paramètres, la croissance du cache KV et l’effort de raisonnement déterminent le coût réel en mémoire et en calcul pour exécuter un modèle de langage localement.
2722 motsLireLorsque les passes de quantification dépassent le niveau de perplexité et compromettent discrètement la sécurité du modèle
La quantification de la mémoire cache KV à faible nombre de bits peut éliminer les refus d’un modèle sans que la perplexité ne change presque pas ; voici pourquoi les métriques standard ne le détectent pas et ce qu’il convient d’ajouter à votre mécanisme de contrôle.
1625 motsLire
À propos de ces articles
Devis en 24 h
Besoin du même stack en couche opérateur ? Envoyez le brief — devis sous 24 h.