Jev:非生成式AI模型如何将文本转化为决策
了解 Jev 的数值型“System One”人工智能模型是如何运作的,为何它比大型语言模型更快更便宜,以及它在生产系统中的生成式人工智能体系中处于何种位置。
Jev究竟是什么?
如果你最近在Twitter或Hacker News上关注过与AI相关的内容,很可能见过Jev这个名字。有人将其描述为“去掉LL的LLM”,一旦深入了解其含义,就会发现这个称呼其实很有道理。
以下是用通俗语言解释它是什么以及为何重要。
Jev是一种新发布的AI模型,由曾任职于OpenAI的工程师Diogo Almeida创立的初创公司TypeSafe AI于2026年9月推出。在经过两年的低调运营后,该公司终于推出了Jev作为首款产品,并获得了4000万美元的种子轮融资支持。
有趣的是:尽管备受关注,Jev 并不属于传统意义上的大型语言模型。ChatGPT、Claude 和 Gemini 等工具的运作方式基本相同——你输入文本,它们就会生成更多文本作为回应。而 Jev 完全颠覆了这一模式。你向它输入文本后,得到的不是段落或解释,而是数值输出:概率、置信度值以及评分。没有叙述性的回应,也没有用句子表达的推理过程,只有数字而已。
TypeSafe 为这种技术路线赋予了新的名称:“System One”模型。一些开发者非正式地将它们称为“决策模型”,这一术语或许能更清晰地描述其功能。
这个名字本身就源自经济学。“Jev”是19世纪经济学家威廉·斯坦利·杰文斯的缩写,他因“杰文斯悖论”而闻名——该理论认为当使用某物的成本下降时,人们并不会减少消费,反而会大幅增加消耗。TypeSafe本质上是在赌,随着人工智能驱动的“思考”功能成本下降,它将渗透到比目前更广泛的软件领域中。
Jev究竟是如何工作的?
一个有用的思维模型是将Jev视为嵌入在代码中的高效函数调用,而非对话助手。
要使用它,需要提供两个输入参数:
- “状态”——即原始数据,可以是文本,也可以是结构化数据,比如支持工单、产品列表、邮件往来、文章,或是几乎任何其他类型的内容。
- 针对该状态您希望得到解答的一个或多个问题。
Jev不会以完整句子的形式回复,而是对您提出的每个问题返回一个数字。它支持三种问题格式:
- 是/否问题——内部称为“Noul”问题,这一名称源自概率论中使用的伯努利分布。例如询问“这是垃圾邮件吗?”,系统会返回类似0.94的概率得分。
- 多项选择题——您提供一系列可能的答案,Jev会为每个答案分配一个置信度分数。
你也不必限制每份文档只能提一个问题。关于同一输入的多个问题可以整合到单个请求中,这样你就能一次性获得所有的数值答案。无需处理对话式的来回交流,也无需事后解析文字内容——只有结构化的数字,让你的应用逻辑能够立即对其进行处理。
对开发者的吸引力:速度与成本
这可以说是Jev受到关注的最大原因。根据TypeSafe公布的数据:
- 响应时间在70到500毫秒之间,这比通常从标准大语言模型调用中获得的响应速度快得多。
- 在类似的工作负载下,TypeSafe的运行速度是顶尖大语言模型的40到200倍,成本却仅为后者的一小部分——据称在某些对比中,两者之间的成本差距甚至可达400倍。
它的定价结构也与众不同。大多数大语言模型服务商会分别收取输入token和输出token的费用,其中输出部分的成本通常更高。而Jev完全颠倒了这一模式:用户只需为输入付费,费用标准为每百万个token 0.042美元,输出则完全免费。考虑到这里的输出只是一小组数字而非生成的文本,这一定价就显得合情合理了。据称,这种定价结构在成本方面甚至优于GPT-5 Nano这类轻量级、经济型的模型。
在轻信这些数据之前,有必要先注意一个要点。TypeSafe自身的技术文档也承认,用于生成这些数值的基准测试任务是由其团队内部设计的,因此那些出色的性能数据很可能反映的是理想状况,而非日常典型工作负载下的实际表现。这并不意味着这些说法是错误的,但确实有理由在得到独立验证之前,对“快200倍”这样的表述持谨慎态度。
Jev的实际应用场景
Jev并非旨在取代聊天机器人或内容生成工具——它短期内还不可能写出像这篇文章这样的作品。相反,它的设计目的更为具体:在软件系统内部实现快速的分类决策。目前已出现了一些应用案例:
垃圾信息与内容审核——无需调用完整的大型语言模型来判断消息是否为垃圾信息或包含恶意内容,Jev几乎可以立即以极低的成本给出判定结果。
优化搜索结果——典型的工作流程是先使用BM25这类低成本方法获取100个候选结果,再让Jev为每个结果评分,评估其与搜索查询的关联度。过去,要对100个候选结果全部使用大型语言模型进行处理成本过高,不具实用性,但Jev的定价使其成为可能。
标记、排序与优先级划分——比如按紧急程度对支持工单进行排序、对内容分类或为销售线索评分等任务,都属于重复性的判断工作。过去,团队不得不在成本高昂的大型语言模型处理与脆弱的规则驱动逻辑之间做选择。
监督其他人工智能智能体——随着越来越多的企业推出自主智能体,人们越来越需要监控这些智能体是否存在错误或试图绕过安全限制的行为。仅使用大规模大型语言模型来承担监督任务会很快带来高昂成本。由于Jev的运行成本极低,因此让它在后台持续监控智能体的行为变得十分实用。
决定使用哪种模型——在将请求转发给成本高昂、功能强大的模型之前,通常可以先询问一个简单的问题:这项特定任务真的需要那么强的处理能力吗?Jev的速度与低成本使其非常适合实时处理这类筛选工作,从而显著降低整个流程的成本。
有一位测试Jev的开发者将其与谷歌的Gemini用于业务邮件分类任务进行对比。结果显示Gemini的准确率略高,但其成本却是Jev的10到20倍。令测试者印象深刻的不只是价格差异——更重要的是Jev能给出经过精确校准的概率分数,而非仅是听起来很有把握的猜测,这大大降低了构建可靠自动化系统的难度。
不容忽视的权衡
还有一个同样值得重视的问题:实际上Jev比传统的大型语言模型更难被审查,而非更容易。
使用 ChatGPT 或 Claude 时,你可以要求模型解释其答案,并获得某种形式的推理过程,即便这些推理并不总是一无瑕疵。而 Jev 并不提供这样的功能——你只能得到一个数值分数,除此之外别无其他信息。这正是它快速且廉价的原因之一,但同时也意味着在训练过程中嵌入的任何偏见都更难被发现或质疑。一些早期使用者已经对 Jev 在特定应用场景中的评分中出现的隐性偏见表示担忧。
还存在另一层透明度问题,属于技术层面。TypeSafe并未公开Jev的架构、模型权重或任何相关研究论文。目前公开的信息十分有限:该模型基于变换器架构,仅使用合成数据训练,并通过该公司所称的“用于精确决策的强化学习”(RLCD)方法构建。在这种设计中,模型的概率输出是根据实际现实世界结果进行调整的,而非通常用于微调聊天型大语言模型的用户偏好排序。一些外部观察人士推测Jev的底层可能基于某个现有的开源模型,但TypeSafe对此既未确认也未否认。
总结
Jev代表了一种将人工智能嵌入软件系统的独特方法。它无需让庞大且昂贵的模型先生成一段文本再从中提取答案,而是直接以数字形式在几毫秒内输出答案,成本也仅为前者的一小部分。
它并不打算取代ChatGPT或Claude这类模型在写作、复杂推理或开放式对话等任务上的功能。但对于现代应用程序背后那些日常且高频的决策——比如判断消息是否为垃圾信息、搜索结果的相关性如何、支持工单的紧急程度等——它很可能在幕后承担着不成比例的实际工作量。
“决策模型”是会发展成独立的持久类别,还是最终仅成为一种小众工具,这仍是一个未解之谜。但如果杰文斯悖论在此适用的话,降低智能系统的成本并不一定意味着人工智能在日常生活中的参与度会下降——相反,它可能意味着人工智能会在背后默默做出成千上万次你根本不会察觉的细微判断。