Artículos para quien
entrega el stack
Textos originales sobre React, Node.js, TypeScript y AI — de la misma práctica que nuestro software de operador. Cuerpo de los artículos en inglés.
Etiqueta: gpu
Procesamiento por lotes continuo y relleno previo en bloques en vLLM y SGLang
Los lotes estáticos de LLM desperdician la GPU en rellenos innecesarios. La programación a nivel de iteración y el prellenado por bloques mantienen fluidos los flujos de decodificación mientras los nuevos prompts siguen avanzando.
1144 palabrasLeerOptimización de la inferencia de LLM: prefill, decodificación y LLMOps empresarial
Cuellos de botella en el prellenado previo vs. la decodificación, procesamiento por lotes continuo, FlashAttention, cuantización, PagedAttention, decodificación especulativa, prellenado previo por bloques y servicio desagregado.
1809 palabrasLeerEjecutando Qwen3.8-27B en una RTX 3090 con vLLM actualizado y DFlash2
Cómo un fork fijado de vLLM 0.28.0 con embeddings requantizados y especulación DFlash2 permite ejecutar un modelo híbrido de 27 mil millones en una tarjeta de 24 GB, y dónde el contexto largo lo ralentiza.
3193 palabrasLeerServicio de Qwen3.8-Flash-Next en RTX 3090 con carga externa de tensores mediante llama.cpp
Por qué un modelo disperso de 88 GB y 180 mil millones de parámetros cabe en las GPUs para consumidores, y cómo flags como -ot, -ncmoe y mmap de llama.cpp lo distribuyen entre VRAM, RAM y NVMe.
2691 palabrasLeer
Sobre estos artículos
Presupuesto en 24 h
¿Necesitas el mismo stack en una capa de operador? Envía el brief — presupuesto en 24 h.