工程笔记
写给真正
交付技术栈的人
关于 React、Node.js、TypeScript 与 AI 的原创文章,来自与我们操作层软件同一套工程实践。正文为英文。
标签:evaluation
生产环境中重要的六项RAG评估指标
Recall@K、nDCG、MRR、忠实度、延迟以及成本——如何调试那些在数据上表现良好但实际答案质量却不断下降的检索系统。
2244 词阅读基于规则的决定模型与大型语言模型调用:边界处的延迟与稳定性
一项包含240次调用的实验,用于比较Jev所给出的固有概率与大型语言模型自我报告的概率,以及如何将这一差异转化为LangChain模型路由器。
2630 词阅读根据每项成功任务的成本来决定代理模型升级方案
一个用于判断是否值得采用更自主模型的实用框架:六项指标、可重复的编码智能体试验,以及该试验所需的控制条件。
1756 词阅读为前沿大语言模型调用前的键入式决策路由器定价
如何使用类似Jev的类型化决策模型来建模控制LLM流量的预期成本,设定置信度阈值,并在部署前验证路由质量。
2655 词阅读通过结果测试AI智能体:验证状态而非依赖回复
学会通过检查最终状态、动作轨迹及真实性来评估使用工具的AI智能体,包括超时情况、无动作场景以及重复试验的可靠性。
2131 词阅读自行训练大语言模型评估器:从PandaLM和JudgeLM到Prometheus
如何构建经过精细调优的评估模型,涵盖从数据与评分标准到偏见控制及元评估的全流程,以及训练领域专用大语言模型评估器的实用方法。
8925 词阅读通过一个客服机器人请求追溯出的十五个大语言模型概念
通过AI助手一步步解答客户问题,了解模型、令牌、嵌入向量、上下文、RAG、智能体以及评估机制的实际作用,以及每一种技术的应用边界。
3094 词阅读逐步优化RAG答案,一次只做一项调整
一种用于改进薄弱RAG回答的以度量为先的工作流程:依次调整分块、top_k、重排序、混合搜索和查询重写策略,并持续监控检索指标。
868 词阅读大语言模型应用评估工具:数据集、评分机制与回归阈值
了解什么是LLM评估工具,它的四个核心组成部分,以及它如何在内容呈现给用户之前检测提示词导致的性能下降,并实现模型间的公平比较。
1985 词阅读
常见问题
关于这些文章
是。每篇都是为本站准备的英文原创改写。结构与代码跟随来源;正文重写并做过重合检查。
技术文先发英文,以保证代码与 API 名称准确。站点外壳提供全部九种语言。
草稿经编辑后进入发布队列。站点导入只收录新的或有变更的 slug,不会重复添加。
示例仅供说明。上线前请核对技术栈与许可。若需交付,请发来简报。