首页 / 文章 / 为何真正需要警惕的是对AI的获取权限,而非技术能力本身。

为何真正需要警惕的是对AI的获取权限,而非技术能力本身。

本文通过分析近期涉及Claude和GPT-5.6的出口管制事件,论证获取AI模型这一因素是独立于原始技术能力之外的不稳定变量。

2598 词

究竟是什么将租赁智能与拥有智能区分开来?

大约三年来,整个行业一直专注于完全错误的评估标准。

人们就基准测试、推理能力、幻觉率以及上下文窗口大小等问题展开激烈争论——这些都是衡量这些系统智能程度的指标。

但如今更重要的问题是:谁掌握着能够关闭这种智能的开关?

2026年6月12日,美国政府对Anthropic最新的两款模型Claude Fable 5和Claude Mythos 5实施了出口限制。

该命令要求Anthropic切断外国人的访问权限,无论他们身处美国境内还是境外。

Anthropic表示没有可靠的方法能够实时确认国籍。

面对这一情况,该公司采取了极端的措施:它禁止所有外国用户使用这两款模型,包括其自己的员工。

18天后政府才取消这些限制。7月1日,《Fable 5》在全球重新上线,而《Mythos 5》在6月26日获得政府批准后,也重新向特定的美国机构开放。

OpenAI随后几乎走了完全相同的路,只是出发点相反。

6月26日,OpenAI推出了GPT-5.6,但应政府要求,最初仅允许少数经过预先审核、身份已向官方公开的合作伙伴使用。OpenAI公开表示,不希望今后再以这种由政府牵线的推广方式作为常规做法。

到7月9日,GPT-5.6向所有人开放。

思考一下这一系列事件究竟揭示了什么。

没有任何数据因代码故障而被截获、删除或损坏。

然而有一段时间,市面上一些最先进的商业人工智能系统虽然技术上仍可运行,但那些需要使用它们的用户却无法接入

这一事件为关于人工智能发展节奏的持续讨论增添了新的维度——问题不再仅仅在于我们应该多快提升系统能力,还在于如何谨慎地安排系统的推出与用户访问的顺序。

真正的启示并非是访问权限正在消失,而是访问权限其实是一个独立变量,与系统能力本身相互分离,遵循自身的逻辑,在独立的时间线上运行,并且能够以任何组织都无法反应的速度向任一方向变化。

这比窗户慢慢关闭的情况要令人担忧得多,因为对于逐渐缩小的窗口,你还可以制定应对计划。但对于那些会在几天时间内被人为地、以不可预测的方向切换的装置,你却无从规划。

因此有一个值得深思的问题:如果你所依赖的模型在一夜之间消失,你的工作还能继续吗?

所有权并非可下载之物

当人们意识到存在依赖性时,他们的本能反应就是去获取某种东西。

下载开源模型权重,将其存储在硬盘上,就以为可以高枕无忧了。但实际上,拥有参数集仅能满足真正独立性所需的一小部分条件,将两者混为一谈只会带来一种虚假的安全感——就像买了备用发电机却从不检查它是否真的能启动一样。

一个能够执行有效任务的智能体实际上是由至少五个组件构成的:模型权重本身、运行这些权重的推理引擎、累积的项目上下文、它可以调用的工具,以及用于判断某个替代方案是否真正能发挥作用的评估系统。

下载的模型文件只是这个组件堆栈中的一小部分而已。

真正的独立性需要拥有运行该模型的法律权利、仅凭文档就能重新构建的推理运行环境、可自由导出的项目状态、由应用程序而非供应商控制的工具权限,以及能够证明替代系统确实能完成工作的证据。

仅从法律层面来看,其复杂性就远超表面所见。

“开放权重”与“开源”并非可以互换的概念——开源倡议组织的定义要求的远不止能够下载参数这么简单,而且运行时的宽松许可也并不自动涵盖所有通过该环境运行的模型。

你需要仔细阅读管理每个软件组件的具体许可协议,并将该协议的副本与组件一同存档保存。

数据所有权属于完全独立的范畴。根据 Anthropic 的商业条款,客户对其提交的任何内容保留权利,双方共同拥有生成结果的所有权,且 Anthropic 被禁止利用这些服务对客户内容进行训练。仅仅将内容发送给服务提供商并不会使您失去所有权。这些内容之后是否会被保留则是另一个独立的问题,其答案取决于具体的产品、合同及配置——而非您曾在某处读到的内容。

以上内容并非反对使用托管模型。

这只是想提醒大家,“我们拥有自己的 AI”这一说法实际上包含了五六个必须同时满足的条件,而大多数团队从未认真检查过这些条件。

自给自足的算术

计算模型需要多少存储空间是其中最简单的部分:只需将参数数量乘以每个参数所占的位数,再除以八即可。

一个拥有80亿个参数、精度为16位的模型大约需要16GB的存储空间;若将精度降至4位,则存储需求约为4GB。而一个拥有700亿个参数的模型,在16位精度下需要约140GB的存储空间,4位精度时则约为35GB。

通常人们就在这里停止考虑硬件需求,而这也是他们最常算对的部分。

真正的错误往往出现在后续的环节中。

KV缓存——用于存储对话中注意力状态的结构——会随着上下文窗口的变长而扩大,同时处理的请求数越多,其规模也会随之增长。

专家混合架构又带来了新的问题:由于每个标记仅激活网络中的部分节点,因此每个标记的实际计算量保持较低,但无论是否处于活跃状态,每个专家模型都仍需占用内存空间。

了解有多少参数被激活可以反映每个标记的处理成本,但无法说明模型占用的空间大小。

将模型的部分组件转移到其他地方并不能解决存储问题,只是将其位置转移而已——这样一来就会产生之前不存在的数据传输开销。

一个能够成功加载到内存中的模型,并不能证明它确实具备处理实际请求的能力。

提示词处理速度、生成速度以及完成任务的总时间是三个不同的指标,能够快速接收提示词并不意味着长篇回复的生成速度也会很快。

真正重要的工作负载是那些要求较高的场景——大型文档、多个同时使用的用户,以及需要反复来回调用的工具功能。

仅用单个简短的提示词进行测试,会掩盖那些在多人共享设备时会导致本地推理效率低下的排队延迟和内存竞争问题。

这些错误都有一个共同点:它们都选取了一个容易提及的数值,却误将其当作真正的限制因素。

在做出决定之前,先在自己已有的硬件上运行基准测试,或者租用与你要评估的配置完全相同的设备进行测试。

在尚未找出真正瓶颈所在之前就进行购买,只会让那个瓶颈持续存在。

提示语并非授权指令

在智能体设计中,最严重的误解几乎与所使用的模型无关。

当模型发出工具调用请求时,那仅仅是一种请求而已。

必须另有机制来决定是否真正执行该请求。

令人惊讶的是,很容易构建出这样一种系统:那个独立机制实际上就是模型对自己行为的信任——再加上提示语中某处要求它遵守界限的礼貌指令作为强化。

那只是偏好而非真正的限制,而正是这类偏好被提示语注入攻击所利用。

智能体从外部来源获取的任何内容都视为不可信输入。

README 文件可以包含针对代理的指令。源代码中的注释、问题跟踪系统中的内容,或是普通网页也能起到同样的作用。

解决办法并非更智能的指令,而是一种更为严格的权限模型:将访问权限限制在经过审批的路径集合上,而非整个文件系统;限制文件大小;控制可写入的内容;在临时环境中运行测试;确保部署凭证不会被工作进程获取;并且在任何补丁投入生产环境之前,都必须由人工进行审核。

在本地运行推理与限制工具权限是两个不同的问题,人们很容易误以为解决了其中一个问题就等于解决了另一个。

自行托管权重决定了数据的实际存储位置,以及系统是否依赖其他公司的正常运行。但这与代理实际被允许执行的操作毫无关联。

那些将这两者混为一谈的团队,最终得到的虽然是完全自托管的模型,却仍可能对其自身的代码库造成不可控的破坏。

在整个团队的规模下,同样的逻辑要求在推理接口前设置经过身份验证的网关,为每个用户设定使用额度,并为每种工作流程明确制定策略——是在本地运行、允许使用特定的托管模型,还是将其转交给人工审核。

在重试失败的步骤之前先保存检查点,同时要让任何可能产生副作用的工具具备幂等性,这样在恢复尝试时就不会默默重复已经执行过的操作。

为何可靠性会反过来对你不利

假设在自动化工作流中的每一步都有95%的独立成功概率。将这十步串联起来,整体成功率约为60%——0.95的第十次方结果大约是0.599。

如果增加到二十步,成功率则降至约36%。

现实中的步骤并非真正独立,因此这只是一个示例而非精确的基准。不过它确实说明了即便模型质量再高也无法改变的事实:每一步的可靠性并非简单相加,而是呈指数级乘积关系,且随步骤数量增加而加剧。

如果将每一步的可靠性从95%提升到98%,十步流程的成功率可从60%上升至82%。但在一个可靠性为95%的流程上再增加十步,所带来的收益就会被完全抵消甚至更多。

这改变了人们对小型本地模型的预期。它的真正作用并非追求卓越性能,而是在流程较短、范围有限、易于检查且出问题时便于恢复的情况下保持稳定性。

至关重要的是,该流程中的步骤数量并非由模型权重决定,而是你在构建应用程序时所做的设计选择。

通过简化流程、检查中间输出,并设置检查点以便在出错时从上次状态继续而非从头开始,通常能比使用更大型的模型获得更高的可靠性。

这也是为什么评估不能停留在模糊或主观的层面。

从你实际的任务清单中选取五十项任务,每项任务的预期结果都需记录在智能体无法写入或篡改的地方。

需跟踪工具调用的有效性、延迟时间、需要重试的次数,以及人工后续处理问题所花费的时间——所有这些都在实际的上下文规模和并发级别下进行测量,并根据您事先设定的阈值来判断,从而确定哪种模型更优。

在您的监控数据中,有一种差异值得单独列出来:无法访问的模型与给出错误答案的模型属于根本不同的故障类型。

前者是路由和恢复问题,后者则是质量问题。

如果将它们合并为一个成功率数值,就会丢失那些能表明真正解决方案是增加处理能力、选用更好的模型,还是执行更小规模、限制更多的任务的关键信息。

您实际购买的是什么

唯一值得比较的指标是每个被成功处理的任务的成本。

比较代币价格是在对比本质上不同的事物;而比较被接受的任务则是在对比本质相同的事物。在本地模式下,成本包括硬件折旧、电力消耗、维护费用、空闲时间以及审核工作量;在托管模式下,成本则为代币费用、重试次数以及审核工作量。

应在双方相同的通过标准下运行相同类型的任务——否则这种比较就毫无意义了。

计算结果会如你所预期的那样。

假设本地基础设施的固定成本为每月600美元,每项被接受的本地任务成本为2美分,而通过托管API处理的相同任务成本则为20美分。那么每月需要处理约3,333项任务才能实现盈亏平衡。

这些数据仅为示意,并非实际测量结果,但背后的规律依然成立:在本地进行推理属于固定成本投入,只有当处理量达到一定阈值时才能盈利,否则就会亏损。

大多数团队的处理量都低于该阈值。

正是在这一点上,关于本地 AI 的客观事实与营销宣传出现了巨大分歧。

在未达到盈亏平衡点时,本地推理并非更便宜的选择,若声称相反,一旦有人实际核查数据,这种说法就会站不住脚。

实际上你购买的是一种选择权——即确保即使在访问条款发生变化的情况下,也能在自身可控的条件下继续运营。

选择权的定价依据是波动性,而非预期的平均结果。

如果近期的干扰事件说明了什么,那就是这种波动是真实存在的,它源于管理决策而非技术问题,并且会毫无征兆地出现。

这正是投入资金的合理理由。

但这与通常给出的理由不同,应当基于其自身价值来辩护,而非伪装成节约成本的措施。

真正能说明问题的测试

所有这些都不取决于“规模定律会持续有效”、“某种访问窗口确实正在关闭”,或是“AGI最终能否适应特定容量的VRAM”这样的假设。

这些都是预测,即便它们不成立,这种依赖关系带来的风险依然存在。

我们只需要认识到,所依赖的系统可能会因与性能好坏或使用方式无关的原因而瘫痪。电网、海底电缆、支付网络都是如此,现在显然人工智能模型也不例外。

实际的应对措施并不令人振奋。它大多意味着要学习那些你目前视为理所当然,或以为别人已经处理好的技能。

试试这个方法:根据你保存的笔记和备份完全重新构建你的技术栈,然后将这些笔记交给另一位工程师,观察他们独立尝试进行同样的重建。通过这个简单的练习,你就能比与当前在线的模型进行的任何多次流畅对话更能了解自己实际的自主能力。模型现在的可用性并不能说明明天的情况,而衡量系统韧性的唯一真正标准就是在没有该模型的情况下它能否正常运行。

相关阅读

  • 代理式AI详解:从语言模型到自主智能体 — 通过工具、内存、规划、多智能体架构以及MCP集成,系统阐述大型语言模型如何演变为代理式系统。
  • 当AI编写你的React应用却忽视整洁代码原则时 — 了解七种整洁代码习惯——DRY原则、单一职责原则、防护条款等——以及AI生成的React代码为何常常违反这些原则,还有相应的修正方法。