首页 / 文章 / 六个能告诉你在信任某个答案之前应检查什么的人工智能概念

六个能告诉你在信任某个答案之前应检查什么的人工智能概念

令牌、上下文窗口、温度参数、幻觉现象,以及被用作验证工具的RAG与智能体,帮助你发现错误、控制成本,并判断人工智能产品的宣传内容是否真实。

2235 词

你将一份报告交给人工智能助手,得到的却是一份经过润色的摘要,其中还包含一个在文档中根本找不到的图表。当你询问此事时,助手道歉并提供了另一个图表。是信息缺失、检索失败,还是这个数字纯粹是编造的?通过从其所影响的决策角度来理解六个核心概念,你可以用一个精确的诊断性问题替代“它为什么在撒谎?”,同时这些概念还有助于你控制成本并评估供应商的声明。

为何怀疑是合理的默认态度

即便是在每天使用人工智能的人当中,对其输出结果的不信任感也很普遍。根据2025年Stack Overflow开发者调查,在33,244份回复中,有46%的受访者表示不信任人工智能的输出结果,而相信其准确性的仅为33%(调查数据)。需注意:这项调查记录的是开发者的观点,并非对模型准确性的实际测量,也不具备整体人群的代表性。不过它确实反映了现实存在的矛盾——人们虽然使用了这些工具,却依然不对它们所说的所有内容全信。

首先,用同样的标准审视新闻标题

关于人工智能的内容常常宣称,只需掌握少量术语就能让你“超越90%的人”。这听起来像是研究结果,但实际上并无相应研究支撑,不过是披着统计数据外衣的营销话术。不妨问一些关键问题:超越谁?如何衡量?参与者是谁?结果发表在何处?没有评估标准、没有样本、没有数据,这样的百分比就毫无依据。但这并不意味着所有相关解释都是错误的,也无法说明任何人的意图;它仅仅表明这个数字毫无说服力。

了解定义只是起点。运用这些定义、识别例外情况以及验证实际输出则是不同的技能,而这些都无法通过一个光鲜的百分比来衡量。

同样的原则也适用于那些声称单个提示词就能替代整个团队,或是某种工具能让所有人的工作效率提升十倍的承诺。应当明确要求了解具体任务内容、基准标准、衡量方式以及存在的局限。一个令人印象深刻的演示并不能证明普遍性的结果。一个吸引人的标题固然不错,但问题在于当宣称的内容比支撑它的证据更为精确时。请用同样的标准来衡量这些内容。

1. 令牌:任务的实际规模

令牌是语言模型实际处理的文本单位。根据分词器的不同,一个令牌可能是一个完整的单词、单词的一部分、标点符号或其他文本片段,而分词器会将每个片段映射为一个数字标识。

并不存在“一个单词等于一个标记”这样的固定规则。Hugging Face的分词器概述介绍了多种方法,包括字节对编码、WordPiece以及与SentencePiece相关的算法,同一句话用不同的分词器处理时可能会产生截然不同的分割结果。非英语语言、代码以及特殊格式的文本通常每个单词对应的标记数更多。

这一点的重要性可以通过这样一个问题体现出来:

哪三种客户投诉出现得最频繁?

这个问题本身很简短。但如果要回答它需要阅读数千条支持消息,那么这个问题的影响在整体输入量中就相当于一个微小的误差。作为粗略估算:400条消息,每条大约150个标记,还不包括任何指令或其他上下文信息,就已经达到了60,000个标记。

因此,关键问题不在于提示语的长度,而在于任务要求系统处理的资料量。由于定价、延迟和上下文限制通常以令牌数来表示,成本也由此决定。在处理大型文档任务之前,应剔除重复的邮件签名、无关的附录以及无法提供有效证据的重复记录,同时保留答案真正依赖的所有内容。

2. 上下文窗口:模型在单次请求中能看到的内容

上下文窗口限定了模型在单次请求中可以处理的资料量。系统指令、对话历史、检索到的段落以及任何其他输入都会占用这一额度;输出令牌数的计算方式则因模型和API的不同而有所差异。谷歌关于长上下文功能的文档说明了较大的上下文窗口如何让模型能够处理大量的文本和其他媒体资料。

然而,接收文档并不等同于能够可靠地利用其中的所有相关细节。2023年的研究《迷失在中间》对多文档问答与键值检索进行了测试,发现对于所研究的模型而言,当相关信息位于长输入的中间而非开头或结尾时,准确率往往会下降。这应被视为那些特定实验的历史证据,而非当今模型的性能指标,但关于需要仔细核查的教训依然适用。

聊天产品也很少会按照其界面所显示的方式运行。当对话内容超出显示窗口时,应用程序不必直接丢弃最旧的消息,而可以选择总结、筛选或调出之前的内容。你在聊天记录中看到的,并不能真实反映每次调用时传递给模型的全部信息。

在实际应用中:

  • 对于需要长时间处理的任务,应编写简明清晰的说明,列出当前的要求与决策,并在必要时重新阐述。
  • 当结论取决于某一段文字时,应在助手得出结论之前要求其引用或定位该段落。

较大的窗口能为系统提供更多操作空间,但这并不能证明系统使用了正确的证据。

3. 温度参数:控制多样性而非真实性

在生成的每一步中,模型都会为所有可能的下一个标记打分。温度参数会改变用于从这些分数中抽样的概率分布:较低的值会使概率集中在最可能的选项上,而较高的值则会让概率分散到更多选项中。Hugging Face将温度参数与top-p抽样和贪婪解码等相关的生成控制选项一起进行说明。

一个诱人的捷径是“低温意味着更准确”。但事实并非如此。如果模型最可能的答案是错误的,降低多样性并不能补充缺失的事实,只会让同样的错误更频繁地出现。同样,提高温度也不能保证产生更好的想法,只能让想法更多样化。

两项对比任务就能体现这种差异。为一家虚构的咖啡馆生成五个名称时,多样性很有用;而提取发票号码则需要一致的格式,但这些数字仍必须与实际发票相符,温度对此并无影响。

将温度视为一个可试验的参数,并根据任务的实际需求来评估其效果。在数据提取时,要统计错误和缺失的字段;在头脑风暴时,则需判断这些想法是否既具有实用性,又彼此之间存在真正差异。可预测性与正确性则需要分别进行检验。

4. 虚构内容:超出证据范围的输出

此处所说的虚构内容,指的是那些编造的、事实错误的,或与其声称描述的素材无关的内容。自信的语气会使其更难被察觉,但信心并非定义的组成部分;含糊的表述同样可能毫无依据。

编造的研究论文是显而易见的例子。更为隐蔽且常见的情况则是引用了一篇真实论文,却声称该论文包含了它实际上并未报告的结果,而由于存在引用,这种错误在粗略查看时很难被发现。

TruthfulQA基准测试包含了38个类别的817道问题,这些问题都是基于常见的误解设计的。在最初的评估中,表现最好的模型在58%的问题上给出了正确答案,而人类的准确率则为94%。这些是2021年和2022年研究中的历史数据,并不能用来衡量当前的聊天机器人,也不是通用的幻觉率标准。这项研究表明,模型能够忠实再现人类文本中出现的错误信念。

当摘要中出现令人惊讶的数字时,应明确询问其来源:

指出对应的原文段落,说明其日期以及统计所涉及的人群范围。如果该段落无法支持这一数字,则应标明该数据缺乏依据。

然后亲自查看参考资料。模型生成的任何引用都只是一种断言,直到你确认该页面确实存在且确实包含那句话为止。

5. RAG:在回答前获取证据

检索增强生成将搜索步骤与生成步骤相结合。系统会在外部数据库中查找相关资料,将其传递给模型,并要求模型基于这些资料进行回答。

2020年那篇具有影响力的RAG论文将预训练的生成器与基于维基百科索引的检索器结合在一起,发表后就在三个开放领域问答基准测试中取得了最佳成绩。这些结果仅代表某一种研究系统,并不能为所有标有RAG标签的产品提供质量保证。

假设有一名员工询问需要多少天时间来提交费用报销申请。一个完善的系统会调取当前的规则并据此给出答案。如果它错误地调用了去年的规则,那么再出色的表述也无法纠正这个错误——给出的答案虽然流畅,却是错误的。正因如此,通过各个阶段来诊断RAG故障通常比直接查看最终答案更为容易,相关方法可在按故障阶段评估RAG一文中找到。

有两点误解需要澄清:

  • RAG并不一定依赖专门的向量存储。检索步骤可以是传统的关键词匹配、嵌入相似度计算,或是两者的结合;微软的RAG概述中介绍了这些选项,同时也强调了为便于检索而做好内容准备的重要性。
  • 上传PDF并不能证明文档检索确实发生了。正如Google关于长上下文处理的文档所述,某些系统会直接将文档内容放入模型的上下文窗口中。检索与直接的长上下文处理是两种不同的设计选择,某个产品可能会将二者结合使用。
  • 要评估任何文档助手,需提出两个独立的问题:它是否找到了正确的段落?它的回答是否准确反映了该段落的内容?

    6. 智能体:能够自主决定下一步行动的系统

    “智能体”这一术语的使用较为宽泛,因此明确的区分有助于理解。Anthropic关于构建高效智能体的指南将工作流定义为遵循预定义代码路径的系统,而智能体则允许模型动态地指导自身的处理流程及工具使用方式。

    固定的工作流程会按固定顺序从发票中提取字段、对其进行验证并保存记录。而面对不完整的发票时,客服人员可以自行决定打开附件、查找相关订单,并请求补充缺失的信息。

    因此,关键问题在于:系统被允许做出哪些决策和执行哪些操作?草拟的回复与实际发放的退款会产生截然不同的后果。客服人员需要明确界定权限、每项操作都有可观察的结果,以及在无法确定合理下一步行动时能够停止工作的机制。

    步骤越多,失败的概率也就越高。作为一个简化的示例,如果一项任务需要十个步骤,且每个步骤独立完成的概率为95%,那么所有步骤都成功的概率则为0.95的十次方,大约为60%。但实际上,各个步骤之间存在相互依赖关系,重试会改变计算结果,因此这只是一个关于风险累积的直观理解,并非标准基准。实际评估时应关注整个任务是否正确完成,包括所有潜在的副作用,而非单个步骤是否看似合理。如需更深入地了解循环机制,请参阅理解AI智能体:目标、工具、记忆与智能体循环。

    针对实际任务的六项检查清单

    每个概念都对应着可以用于评估任何实际任务的问题:

    • 令牌数:该任务实际上需要系统处理多少数据,有哪些内容可以删除而不丢失证据?
    • 上下文窗口:答案依赖于哪段文本,系统是否真的使用了它?
    • 温度参数:该任务更注重多样性还是一致性,正确性与可预测性是否分别进行了检验?
    • 幻觉问题:每个惊人结论的来源究竟是什么,相关内容是否确实如答案所述?
    • RAG技术:是否检索到了正确且最新的文档,其内容是否被准确呈现?
    • 智能体功能:系统被允许执行哪些操作,整个任务及其潜在影响是否都得到了正确处理?

    总结

    试着在真实的任务中运用这些问题,比如文档摘要、代码修改或客户支持回复,同时将原始材料放在手边。要区分该工具所依据的证据、它自行得出的结论以及它实际执行的操作。持续这样做比任何演示或标题中的统计数据都能更准确地反映工具的可靠性,同时还能将模糊的不信任感转化为具体且可解决的问题:输入内容过多、遗漏了某些段落、使用了错误的文档、引用了不受支持的数据,或是代理权限过大。