工程笔记
写给真正
交付技术栈的人
关于 React、Node.js、TypeScript 与 AI 的原创文章,来自与我们操作层软件同一套工程实践。正文为英文。
标签:vllm
vLLM与SGLang中的连续批处理与分块预填充
静态大语言模型批次会因填充数据而浪费GPU资源。通过迭代级调度与分块预填充,可在新提示持续处理的同时保持解码流程的流畅性。
1144 词阅读大语言模型推理优化:预填充、解码与企业级LLMOps
预填充与解码瓶颈、连续批处理、FlashAttention、量化技术、PagedAttention、推测性解码、分块预填充以及分散式服务。
1809 词阅读小型语言模型的LLMOps:服务框架与生产实践指南
为什么SLMs在成本和隐私方面更具优势,vLLM、SGLang、TGI、llama.cpp、Ollama、WebLLM、ONNX和TensorRT-LLM之间的对比如何,以及如何在生产环境中对它们进行量化、评估和调度。
4127 词阅读在配备已修复版vLLM与DFlash2的RTX 3090上运行Qwen3.8-27B模型
带有重新量化嵌入层及DFlash2预测功能的固定版vLLM 0.28.0分支如何在24 GB显存上运行27B规模的混合模型,以及为何长上下文会降低其运行速度。
3193 词阅读
常见问题
关于这些文章
是。每篇都是为本站准备的英文原创改写。结构与代码跟随来源;正文重写并做过重合检查。
技术文先发英文,以保证代码与 API 名称准确。站点外壳提供全部九种语言。
草稿经编辑后进入发布队列。站点导入只收录新的或有变更的 slug,不会重复添加。
示例仅供说明。上线前请核对技术栈与许可。若需交付,请发来简报。