Артыкулы для тых, хто
выводзіць стэк у прод
Арыгінальныя матэрыялы пра React, Node.js, TypeScript і AI — з той жа практыкі, што і наша аператарскае ПЗ. Тэкст артыкулаў па-англійску.
Тэг: evaluation
Шысьць паказнікаў ацэнкі RAG, якія маюць значэнне ў практычным выкарыстоўванні
Recall@K, nDCG, MRR, адакватна якасць, час адпаведзення і витраты — як дапамога вылучэнню дакументаў, якое на паперы выглядае лепяй, але дае гorsыя рэсультаты.
2244 слоўЧытацьМодэлі рашэння, створаныя за дапамою клавіатуры, протык узываў LLM: зволненне і стабільнасць на межы
Эксперымент з 240 вызамі, які парабяліеўвае абычныя верыятнасці Джэва з тымі, якія сам створыў LLM, і спосабы ператварэння гэтага сигналу ў маршрутазёр модэля LangChain.
2630 слоўЧытацьАдаптаванне модэлі агента на адповіднасць косцу за кожны успешны заданні
Практычная схема для адміністрацыі, чы гэты болей автонамны модель варта адпрацоўваць: шасць паметак, тэст кодавання-агента, які можна паўтарыць, і абмежэнняя, якія ён выкалічвае.
1756 слоўЧытацьЦэна прыстрою для выбора рашэння на адказ на запыткі LLM Frontier
Як моделіраваць запланаваныя выкаленні зв’язку LLM за дапамою модэлі рашэння з типаваннем, такой як Jev, задаць прагі надзеі і пераканаліцца ў якасці маршрутацыі прыямо перад ўпрыемам.
2655 слоўЧытацьТэставанне АІ-агентаў па рынку: перакананне ў стане заместо даверы да адказаў
Навучыцеся ацэніць АІ-агентаў, якія выкарыстоўваюць інструменты, па пераканальнай станові, следах дзеянняў і правдазнасці, уключаючы часавыя ліміты, ситуацыі без дзеянняў і надзею на надзейнасць пасля паўтарных спроб.
2131 слоўЧытацьНавучэнне вашага супэльнага судды LLM: ад PandaLM і JudgeLM да Prometheus
Як ствараюцца добра прытэсаваныя моделі-ацэнавцы, ад дадзейнаў і критэрыяў да контролю пакашанняў і мета-ацэнкі, а таксама практычныя наўказы для навучэння судды LLM, спецыялізаванага на певной галіні.
8925 слоўЧытацьПятнаццац канцэпцый LLM, аналізаванных чераз адзін запит дапаможных ботаў
Следзіце за адною запытаннем кліента через дапамогу AI, каб з’ясаваць, чым насправды займаюцца моделі, токены, эмбеддынгі, контэкст, RAG, агенты і методы ацэнкаў, і дзе канчываецца функція кожнага з іх.
3094 слоўЧытацьУлучшэнне адказоў RAG: адна меравальная змянена за раз
Працэўны прыем па шляху «меры спачатку» для выправлення слабых адпаведзяў RAG: настраівайце чанкавае раздзелэнне, параметр top_k, перыяранкаванне, гібрыдны пошук і перапісва запыткаў па аднаму і стежыце за метрыкамі выкарыстоўвання дадзеных.
868 слоўЧытацьПррыстроі для адзякання дапыткаў у додатках LLM: наборы дадзеных, адзяканне і механізмы вылучэння регрэсій.
Дазвольце даклэ научыцца, што такое прыстрой для адзякання LLM, якія ў яго чатыры основныя складовыя, і як ён вылучае регрэсіі у запытках і справедліва парабяляе моделі, перш чым яны дастуцься корыстнікам.
1985 слоўЧытаць
Пра гэтыя артыкулы
Ацэнка за 24 гадзіны
Патрэбны такі стэк у аператарскім слоі? Дашліце брыф — ацэнка за 24 гадзіны.