Artículos para quien
entrega el stack
Textos originales sobre React, Node.js, TypeScript y AI — de la misma práctica que nuestro software de operador. Cuerpo de los artículos en inglés.
Etiqueta: vllm
Procesamiento por lotes continuo y relleno previo en bloques en vLLM y SGLang
Los lotes estáticos de LLM desperdician la GPU en rellenos innecesarios. La programación a nivel de iteración y el prellenado por bloques mantienen fluidos los flujos de decodificación mientras los nuevos prompts siguen avanzando.
1144 palabrasLeerOptimización de la inferencia de LLM: prefill, decodificación y LLMOps empresarial
Cuellos de botella en el prellenado previo vs. la decodificación, procesamiento por lotes continuo, FlashAttention, cuantización, PagedAttention, decodificación especulativa, prellenado previo por bloques y servicio desagregado.
1809 palabrasLeerLLMOps para modelos de lenguaje pequeños: frameworks de servicio y guías para producción.
Por qué los SLM ganan en costo y privacidad, cómo se comparan vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX y TensorRT-LLM, y cómo cuantificarlos, evaluarlos y enrutarlos en producción.
4127 palabrasLeerEjecutando Qwen3.8-27B en una RTX 3090 con vLLM actualizado y DFlash2
Cómo un fork fijado de vLLM 0.28.0 con embeddings requantizados y especulación DFlash2 permite ejecutar un modelo híbrido de 27 mil millones en una tarjeta de 24 GB, y dónde el contexto largo lo ralentiza.
3193 palabrasLeer
Sobre estos artículos
Presupuesto en 24 h
¿Necesitas el mismo stack en una capa de operador? Envía el brief — presupuesto en 24 h.