Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: llmops
Непрерывная группировка и предзаполнение по блокам в vLLM и SGLang
Статические пакеты LLM тратят ресурсы GPU на заполнение ненужными данными. Планирование на уровне итераций и пошаговое предзаполнение обеспечивают плавную работу потоков декодирования, позволяя новым запросам продолжать обрабатываться.
1144 словЧитатьОптимизация инференса LLM: предзаполнение, декодирование и корпоративные инструменты LLMOps
Проблемы заполнения предварительных данных и декодирования, непрерывная группировка данных, FlashAttention, квантизация, PagedAttention, спекулятивное декодирование, разбитое заполнение предварительных данных и децентрализованная обработка запросов.
1809 словЧитатьАрхитектура ИИ для предприятий: RAG находит информацию, LLMs анализируют её, модели принятия решений выбирают оптимальный вариант
Почему одних только механизмов поиска информации и языкового рассуждения недостаточно — как GraphRAG, агенты и модели принятия решений типа System 1, такие как Jev, разделяют знания, контекст, рассуждения, принятие решений и их выполнение.
2111 словЧитатьLLMOps для небольших языковых моделей: фреймворки обслуживания и руководства по внедрению в производство
Почему SLMs превосходят по стоимости и уровню конфиденциальности, как сравниваются vLLM, SGLang, TGI, llama.cpp, Ollama, WebLLM, ONNX и TensorRT-LLM, а также как квантизировать их, оценивать и использовать в производственных условиях.
4127 словЧитать
О этих статьях
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.