Notas de ingeniería
Artículos para quien
entrega el stack
Textos originales sobre React, Node.js, TypeScript y AI — de la misma práctica que nuestro software de operador. Cuerpo de los artículos en inglés.
Etiqueta: vLLM
Ejecutando Qwen3.8-27B en una RTX 3090 con vLLM actualizado y DFlash2
Cómo un fork fijado de vLLM 0.28.0 con embeddings requantizados y especulación DFlash2 permite ejecutar un modelo híbrido de 27 mil millones en una tarjeta de 24 GB, y dónde el contexto largo lo ralentiza.
3193 palabrasLeer
FAQ
Sobre estos artículos
Sí. Cada texto es un rewrite inglés original para este sitio. Estructura y código siguen la fuente; la prosa se reescribe y se revisa el solapamiento.
Los posts técnicos van primero en inglés para que código y APIs sigan exactos. La interfaz del sitio está en nueve idiomas.
Los borradores entran en cola tras la edición. El import solo toma slugs nuevos o cambiados — sin duplicados.
Ejemplos ilustrativos. Valida stack y licencias antes de producción. Para un encargo, envía el brief.
Presupuesto en 24 h
¿Necesitas el mismo stack en una capa de operador? Envía el brief — presupuesto en 24 h.