Статьи для тех, кто
выводит стек в прод
Оригинальные материалы о React, Node.js, TypeScript и AI — из той же практики, что и наше операторское ПО. Текст статей на английском.
Тег: evaluation
Шесть метрик оценки RAG, которые важны в производственной среде
Recall@K, nDCG, MRR, степень точности, задержка и затраты — как отладить процесс поиска, который на бумаге выглядит лучше, но при этом качество ответов ухудшается.
2244 словЧитатьМодели принятия решений на основе ввода текста против вызовов LLM: задержка и стабильность на границе
Эксперимент с 240 вызовами, сравнивающий естественные вероятности, указанные Джефом, с теми, которые само сообщает большая языковая модель, а также способы преобразования этих данных в маршрутизатор моделей LangChain.
2630 словЧитатьОпределение необходимости обновления агентной модели на основе затрат на выполнение одного успешного задания.
Практическая система для оценки того, стоит ли внедрять более автономную модель: шесть показателей, тестирование кодирующего агента с возможностью воспроизведения и необходимые для него контрольные меры.
1756 словЧитатьОпределение цены для механизма принятия решений на основе ввода текста при вызовах больших языковых моделей Frontier
Как моделировать ожидаемую стоимость управления трафиком LLM с помощью типизированной модели принятия решений, такой как Jev, устанавливать пороги уверенности и проверять качество маршрутизации перед её внедрением.
2655 словЧитатьТестирование ИИ-агентов по результатам: проверка состояния вместо доверия к ответам
Научитесь оценивать ИИ-агентов, использующих инструменты, путем проверки конечного состояния, следов действий и достоверности, включая наличие тайм-аутов, случаи отсутствия действий и надежность при многократных попытках.
2131 словЧитатьОбучение собственному судье на основе LLM: от PandaLM и JudgeLM до Prometheus
Как создаются тонко настроенные модели оценщиков, от данных и рубрик до контроля предвзятости и метаоценки, а также практический подход к обучению специализированного судьи на основе LLM.
8925 словЧитатьПятнадцать концепций LLM, рассмотренных через один запрос от бота-поддержки
Пройдитесь по одному вопросу клиента с помощью ИИ-ассистента, чтобы понять, что на самом деле делают модели, токены, эмбеддинги, контекст, RAG, агенты и методы оценки, и где заканчивается функционал каждого из них.
3094 словЧитатьУлучшение ответов RAG: по одному измеримому изменению за раз
Рабочий процесс, основанный на поэтапных мерах, для улучшения слабых ответов RAG: поочередно настраивайте разбиение на фрагменты, параметр top_k, переранжирование, гибридный поиск и переписывание запросов, при этом отслеживайте показатели получения информации.
868 словЧитатьИнструменты оценки для приложений LLM: наборы данных, методы оценки и механизмы обнаружения регрессии
Узнайте, что такое инструмент оценки LLM, каковы его четыре основных компонента, и как он выявляет регрессию в запросах и справедливо сравнивает модели до того, как они попадут к пользователям.
1985 словЧитать
О этих статьях
Оценка за 24 часа
Нужен такой же стек в операторском слое? Пришлите бриф — оценка за 24 часа.