Notas de ingeniería
Artículos para quien
entrega el stack
Textos originales sobre React, Node.js, TypeScript y AI — de la misma práctica que nuestro software de operador. Cuerpo de los artículos en inglés.
Etiqueta: kv-cache
La caché KV es la base de datos invisible que consume memoria en la GPU durante la decodificación de LLM.
Relleno previo versus decodificación, matemáticas KV, GQA/MQA, PagedAttention, cuantización y expulsión para inferencia en producción.
2068 palabrasLeerInferencia de LLM de extremo a extremo: prefill, decode, caché KV y muestreo
Una explicación lista para una pizarra blanca sobre el tokenizador en tiempo real: por qué el prefill está limitado por los cálculos, el decode por el ancho de banda, y cómo GQA, la paginación y la especulación modifican los costos operativos.
9177 palabrasLeer
FAQ
Sobre estos artículos
Sí. Cada texto es un rewrite inglés original para este sitio. Estructura y código siguen la fuente; la prosa se reescribe y se revisa el solapamiento.
Los posts técnicos van primero en inglés para que código y APIs sigan exactos. La interfaz del sitio está en nueve idiomas.
Los borradores entran en cola tras la edición. El import solo toma slugs nuevos o cambiados — sin duplicados.
Ejemplos ilustrativos. Valida stack y licencias antes de producción. Para un encargo, envía el brief.
Presupuesto en 24 h
¿Necesitas el mismo stack en una capa de operador? Envía el brief — presupuesto en 24 h.