Статті для тих, хто
виводить стек у прод
Оригінальні матеріали про React, Node.js, TypeScript і AI — з тієї ж практики, що й наше операторське ПЗ. Текст статей англійською.
Тег: evaluation
Шість метрик оцінки RAG, які мають значення у продакшені
Recall@K, nDCG, MRR, точність, затримка та витрати — як виправляти проблеми з пошуком, який на папері виглядає краще, але призводить до гірших результатів.
2244 слівЧитатиМоделі рішень, створені шляхом набору тексту, проти викликів LLM: затримка та стабільність на межі
Експеримент із 240 викликами, який порівнює природні ймовірності Jevа з тими, які самостійно задає LLM, а також способи перетворення цього сигналу на маршрутизатор моделей LangChain.
2630 слівЧитатиВибір оновлення агентської моделі за вартістю на одне успішне завдання
Практична схема для оцінки того, чи варто впроваджувати більш автономну модель: шість показників, тест кодуючого агента з можливістю відтворення та необхідні для нього контрольні елементи.
1756 слівЧитатиВизначення ціни для механізму прийняття рішень на основі введеного тексту під час викликів Frontier LLM
Як моделювати очікувану вартість керування трафіком LLM за допомогою типової моделі прийняття рішень, такої як Jev, встановлювати пороги впевненості та перевіряти якість маршрутизації перед її впровадженням.
2655 слівЧитатиТестування штучних інтелект-агентів за результатом: перевірка стану замість довіри до відповідей
Навчіться оцінювати штучних інтелектуальних агентів, які використовують інструменти, шляхом перевірки кінцевого стану, слідів дій та їхньої достовірності, включаючи таймаути, випадки відсутності дій та надійність повторних спроб.
2131 слівЧитатиНавчання власного судді LLM: від PandaLM та JudgeLM до Prometheus
Як створюються деталізовані моделі оцінювачів — від даних та рубрик до контролю упереджень та метаоцінки, а також практичний посібник з навчання судді LLM для конкретної галузі.
8925 слівЧитатиП’ятнадцять концепцій LLM, розглянутих через одне запитання від бота-підтримки
Пройдіться з допомогою AI-асистента через одне запитання клієнта, щоб дізнатися, що насправді роблять моделі, токени, ембеддинги, контекст, RAG, агенти та механізми оцінки, і де кожен з них закінчується.
3094 слівЧитатиПокращення відповідей RAG: по одній виміряній зміні за раз
Робочий процес, спрямований насамперед на вимірювання, для виправлення слабких відповідей RAG: поступово налаштовуйте чанкінг, top_k, переранжування, гібридний пошук та переписування запитів, водночас відстежуючи показники отримання даних.
868 слівЧитатиІнструменти оцінки для додатків на основі LLM: набори даних, оцінювання та механізми регресії
Дізнайтеся, що таке інструмент оцінки LLM, його чотири основні компоненти, та як він виявляє регресію у запитах та справедливо порівнює моделі, перш ніж щось потрапить до користувачів.
1985 слівЧитати
Про ці статті
Оцінка за 24 години
Потрібен такий стек в операторському шарі? Надішліть бриф — оцінка за 24 години.