工程笔记
写给真正
交付技术栈的人
关于 React、Node.js、TypeScript 与 AI 的原创文章,来自与我们操作层软件同一套工程实践。正文为英文。
标签:inference
vLLM与SGLang中的连续批处理与分块预填充
静态大语言模型批次会因填充数据而浪费GPU资源。通过迭代级调度与分块预填充,可在新提示持续处理的同时保持解码流程的流畅性。
1144 词阅读大语言模型推理优化:预填充、解码与企业级LLMOps
预填充与解码瓶颈、连续批处理、FlashAttention、量化技术、PagedAttention、推测性解码、分块预填充以及分散式服务。
1809 词阅读为何17GB版本的下载量并不代表运行它需要17GB的内存
了解活跃参数、总参数、KV缓存增长以及推理成本是如何决定在本地运行语言模型时实际所需的内存和计算资源的。
2722 词阅读量化过程如何引发困惑并悄然破坏模型安全性
低位KV缓存量化可以在困惑度几乎不变的情况下消除模型的拒绝现象;这就是为什么标准指标无法检测到这一情况,以及应在门控机制中加入什么内容。
1625 词阅读
常见问题
关于这些文章
是。每篇都是为本站准备的英文原创改写。结构与代码跟随来源;正文重写并做过重合检查。
技术文先发英文,以保证代码与 API 名称准确。站点外壳提供全部九种语言。
草稿经编辑后进入发布队列。站点导入只收录新的或有变更的 slug,不会重复添加。
示例仅供说明。上线前请核对技术栈与许可。若需交付,请发来简报。