首页 / 文章 / TypeSafe AI的Jev:一种用于类型化决策的非聊天型模型

TypeSafe AI的Jev:一种用于类型化决策的非聊天型模型

这篇文章阐述了TypeSafe AI的Jev模型如何完全跳过文本生成环节,直接返回经过校准的类型化答案,以及这种取舍在哪些情况下能带来实际优势。

2471 词

Jev是TypeSafe AI的首个模型,这是一家位于旧金山的初创公司,于2026年9月15日在低调运营多年后正式亮相,其种子轮融资获得了DCVC领投的4000万美元资金支持。

与大多数登上新闻头条的AI系统不同,Jev并非大型语言模型。它无法生成句子、编写代码或起草解释内容。相反,你需要向它提供状态快照,比如客户支持工单或产品列表,以及一组结构化、带类型标注的问题。作为回应,它会给出带类型标注的答案,每个答案都会附有概率分布和置信度评分。无需解读散文式文本,也无需事后修正JSON结构。

TypeSafe将这种方法称为“System One”模型,通过该公司名为“用于精确决策的强化学习”(Reinforcement Learning for Calibrated Decisions,简称RLCD)的技术进行训练。据该公司称,响应延迟在70到500毫秒之间,每百万个输入标记的价格为0.042美元,而输出标记则完全免费。

这一价格信息并非错误。之所以输出免费,是因为实际上几乎不存在需要输出的内容。

TypeSafe AI的创始人是谁

该公司的创始人兼首席执行官Diogo Almeida此前在OpenAI担任研究员,为基于人类反馈的强化学习、InstructGPT、ChatGPT以及GPT-4等项目做出了贡献。他被认为是将原始语言模型转化为可用对话助手的技术RLHF的联合创造者之一。

领导团队还包括担任首席技术官的埃里克·加夫尼和担任首席运营官的沙莎·盛。TypeSafe成立于2024年,在低调运营了近两年后才选择公开上市。据《福布斯》报道,经过这一轮融资后该公司的估值约为2亿美元。

值得注意的是,阿尔梅达曾参与设计出让模型能够擅长满足人类偏好的技术方法,但他现在却认为,满足人类需求其实与打造可靠软件并非同一层面的挑战。当某人开始质疑曾让自己成名的事物时,通常意味着他们已经花了大量时间重新思考这个问题。

该公司名称源自19世纪的经济学家威廉·斯坦利·杰文斯,他因“杰文斯悖论”而闻名——该悖论指出,当某种技术变得更高效时,其整体使用量往往会上升而非下降。这里的逻辑很直接:只要将智能技术的成本降到足够低,其应用范围就会大幅扩展。

问题所在

任何为电子商务平台开发过人工智能功能的人,很可能都遇到过同样的反复出现的难题。

想想这些系统需要做出的判断:这个搜索查询是关于某个品牌还是类别?这张产品照片适合放在首页吗?这条评论是在抱怨配送延迟还是产品质量问题?这些都是些简单的决策,一个称职的类别管理员几秒钟就能解决。

然而,标准的解决方案是通过语言模型来处理这些问题。模型会生成一段文本,然后这段文本会被强制转换为JSON结构。你需要为它编写解析器,添加验证逻辑,实现重试处理机制,并为重试失败的情况准备备用方案。最终,在实际应用中,往往在深夜时分,模型会返回一个在你的分类体系中根本不存在的类别值,从而悄悄破坏下游的商品信息表。

瓶颈从来不是智能本身,而是围绕它的接口。

这正是Jev旨在填补的空白。

它的核心优势并非在于推理能力优于其他模型,而在于其输出格式终于符合应用程序的实际需求。

Jev的实际工作原理

整个API接口仅包含三种问题类型。

选择题允许模型从您提供的列表中选择一个选项,您将获得被选中的项目以及每个选项对应的概率和整体置信度值。单个列表中最多可包含255个候选选项。

评分题要求模型根据您设定的有序等级标准对输入内容进行评分,这些等级可能包括错误严重程度、客户情绪激动程度或产品列表的完成度等。返回的数值可能介于两个相邻等级之间,而非恰好落在某个等级上,同时响应中还会包含该分数背后的完整分布情况。

二元题表示的是简单的“是”或“否”陈述。响应为一个介于0和1之间的数字,代表答案为“是”的概率。

这三种类型可以在单次调用中自由组合。每个问题都会基于相同的输入状态进行评估,彼此独立判断,且同时运行。由于采用并行处理方式,向请求中添加更多问题几乎不会影响响应时间。每次调用都在大约32,000个令牌的共享预算范围内运行,该预算同时用于存储状态和处理问题。

这一令牌预算的设定改变了围绕Jev设计系统的方式。由于额外提问几乎不会产生额外成本,因此推荐策略是尽可能提出所有可能需要的问题,哪怕有些问题的答案仅对特定输入有效,只需丢弃应用程序未使用的部分即可。TypeSafe将这种模式称为“推测性扩展”。对于那些习惯于每次额外调用模型都会带来成本和延迟的人来说,这种激励机制的逆转需要一些时间才能完全理解。

Jev与LLM有何不同

四个独特的特性使其有别于那些仅通过结构化输出格式来伪装的语言模型。

首先,训练目标本身就有所不同。RLHF旨在优化模型,使其给出人类认为不错的答案;而RLVR则着眼于让验证者能够检查的答案,这正是推理模型背后的技术。Jev采用的则是名为RLCD的方法,它训练模型生成决策的同时附带诚实的概率估计。如果Jev给出的置信度分数为0.8,那就意味着在大量类似答案的样本中,大约有80%的实际结果是正确的。在这里,校准并非副产品——它正是该系统的核心目的。

其次,采样是并行进行的而非顺序的。典型的语言模型会逐个生成文本标记,每个新标记都依赖于之前已生成的所有内容。而Jev则能一次性生成完整答案。这正是它速度快的原因,也是为何生成输出无需额外费用——不必逐个计费漫长的标记序列。

第三,输出格式不仅被鼓励,更是有保障的。Jev在功能上仅能返回你事先指定的预定义集合中的值。这并非“通常符合规范”的行为——按设计,不可能返回该集合之外的任何内容。出现虚构的类别不仅极为罕见,从结构上来说就根本不存在于可能的输出范围内。TypeSafe宣称其格式错误的结构化输出错误率为0%,与大多数基准测试数据不同,这一数值是架构本身的直接结果,而非通过实验测得的。

第四,不确定性本身被视为一种真实的输出结果,而非事后才考虑的因素。任何选择或评分结果都会附带一个置信度值,该值是根据底层概率分布的峰值尖锐程度计算得出的。如果概率分布较为平坦,则表明模型存在真正的不确定性。这样一来,应用程序逻辑就可以直接根据置信度作出响应——当置信度超过某个阈值时自动执行操作,低于另一个阈值时则由人工介入,并为高风险操作设定比低风险操作更严格的标准。

最后这一功能可以说是最具价值的。在这些系统中,5%的错误率其实很少成为真正的障碍,真正的问题在于无法确定到底是哪5%的案例出了错。

基准数据实际传达的信息

这一部分确实值得持谨慎态度,因为营销材料往往会对相关内容进行刻意包装,而网上的许多报道也只是简单重复官方公布的数字,并未深入探究。

TypeSafe自行设计了涵盖四种使用场景的基准测试:安全事件响应、代理程序追踪可视化、发票处理以及客户支持,共计约711个测试案例。该测试并未依赖人工验证的准确答案,而是通过综合GPT 6 Astra与Claude Fable 5.1的判断结果来生成参考答案。

以这套参考标准来看,Jev有67.8%的次数能给出正确答案;GPT 5.6 Terra的表现也几乎相同,为67.9%——从表面上看,这对TypeSafe来说是个相当不错的成绩。

但若进一步查看结果表格,情况会有所变化。GPT 5.6 Sol的准确率达到了74.1%,而Claude Opus 5则为73.1%。具体在发票处理子任务上,Jev的准确率为61.8%,而Sol为79.1%,两者相差17个百分点,这一差距在许多潜在用户期望该模型能够擅长的结构化数据提取任务中可谓相当显著。

Jev在成本和速度方面明显更具优势。其处理每个案例的成本约为0.0004美元,延迟时间为0.4秒;而Terra的成本约为3美分,延迟时间为10秒,两个指标上的差距都达到了大约两个数量级。

客观来讲,Jev的准确率处于前沿模型的中等水平,成本仅为前者的四十分之一到四百分之一,响应速度也快至几分之一秒。这种权衡是否合理完全取决于给出错误答案的代价。在处理百万条搜索查询时,这种权衡显得非常出色;但若是用于自动批准退款,就需要置信度过滤机制能实现真正有效的筛选。

有两点需要注意。首先,这些数据是由供应商自行提供的,目前尚未出现独立的大规模验证结果;其次,由于参考答案是由OpenAI和Anthropic的模型生成的,整个对比实际上偏向于优先认可这两类模型的结果。

我会将其用于何处

设想有一个团队正在为一家在多个海湾市场运营的杂货及通用商品电商平台开发探索功能与商品营销功能。这样一个团队可能会按以下方式确定其待办任务中的优先级。

首先需要解决的是大规模目录查询理解问题。一个覆盖多个市场及多种语言的平台会面临海量且分布极广的搜索查询。目前,诸如识别查询意图、区分品牌名称与类别术语及属性,以及标记那些很可能无结果返回的查询等任务,都是通过一系列会随时间失效的规则来处理的,偶尔还会使用大型语言模型,但由于处理量过大,其成本实在过高。鉴于每十亿个输入标记的成本约为42美元,若能每天对每一条查询都进行此类分类处理,从经济角度来说是可行的。

内容质量评分是另一个可行的方案。可以对每个产品列表从标题清晰度、图片质量以及属性完整性等方面进行评分,得分最低的列表会反馈给产品目录团队以便修正。这实际上就是将同一类型的评分问题重复应用数百万次——这类工作传统上使用大型语言模型处理成本过高,而若要转化为严格的规则又显得过于复杂。

搜索调优中的相关性判定是第三种应用场景。无需购买人工标注的相关性数据,也无需花费高昂成本构建模型,只需批量对查询与产品对进行评分,即可形成离线相关性数据集。TypeSafe自身关于重新排序的文档指出,在法律文件检索测试中,首条结果的正确率从5%提升到了18%——这一表现相当可观,尽管该领域与电商搜索并无太多相似之处。

最后,对现有基于大语言模型的功能设置约束也十分合适。对于任何对话式功能的输入和输出进行检测,以识别越狱尝试和政策违规行为时,需要一种快速且成本低廉的检测方式,避免其本身成为瓶颈,而这正是Jev所具备的特性。

我不建议使用的场景

任何需要解释的情况都不适用。Jev根本不会给出推理过程,仅此而已。当商家询问为何其商品排名下降时,告诉他们“模型给它的评分是4分中的2.1分”根本无法让任何人满意。

那些需要在不同步骤之间进行连续推理的任务也不适合使用它。TypeSafe在其官方文档中明确指出:应将问题拆分成独立的子问题,或者选择其他工具,因为合并在一个请求中的各个项目无法知晓彼此的答案。

在任何精度比处理速度更重要的场景中都要谨慎行事。发票处理方面的缺陷并非小问题,而是一个真正的警示信号。

你绝不能在无法先用自己的数据对其进行验证的地方部署它。仅通过他人设计的四项基准测试得到的67.8%综合得分,根本无法说明该模型在处理阿拉伯语产品名称或海湾市场中的商品分类时表现如何。

更深层的意义

暂且不谈发布当天的各项指标,无论Jev是否最终成为该领域的胜出者,都有一个依然成立的根本观点。

文本从来都不是模型与其输出处理软件之间的理想接口。我们之所以使用它,仅仅是因为它是现有的格式,之后又花费数年时间开发解析器、验证工具、重试逻辑和架构检查器来弥补这一缺陷。所有这些层存在的意义,都是将为人类阅读而设计的内容转化为机器能够安全处理的格式。

如果未来大多数人工智能应用都将出现在软件流程中而非聊天界面里——而这似乎是必然趋势——那么承担这些工作的系统或许根本就不应该以生成可读句子为目标进行优化。TypeSafe自己估计,大规模自动化最终大约99%都是机器与机器之间的通信。具体数字仍有争议,但整体发展方向则几乎无可置疑。

Jev或许无法成为引领行业发展的典范。它的应用范围有限,仍处于起步阶段,依赖自我报告的数据,在原始准确度方面也落后于顶级模型。但它确实提出了一个具体且可验证的观点,指出了当前系统中真正的瓶颈所在。

自团队开始推出基于人工智能的功能以来,他们一直在努力解决这个瓶颈问题。如果它能最终消失,那无疑将是一个令人欣喜的变化。

相关阅读

  • Fugu Ultra:AI协调模型如何挑战GPT与Claude — 阐述了Sakana AI的Fugu Ultra v2如何通过多个专业模型而非单一大型语言模型来处理任务,以及其在基准测试、价格和透明度方面的表现。