基于 Stanford《2026 企业 AI 实战手册》(The Enterprise AI Playbook) Chapter 11 学习笔记

开篇:选错模型,会不会输?

“我的关注点不是工具。我的关注点是构建一个平台——平台建好后他们就会用。如果某个模型变得更好或更便宜,你有在模型之间切换的灵活性。” ——科技公司运营主管

每次技术栈选型,团队都要吵一架:GPT 还是 Claude?Gemini 还是 Llama?开源还是闭源?买贵的怕浪费,买便宜怕不行,押错宝怕被供应商锁死。

这一章用 51 个案例给了个反直觉的答案:对 42% 的企业实现来说,选哪个模型根本不重要——它是可以随时替换的”商品”(commodity)。而真正把赢家和输家分开的,不是模型本身,是模型外面的那层东西:数据质量、流程文档、集成架构,尤其是编排层(orchestration layer)

这一章一句话总结:模型会越来越便宜、越来越商品化,但”谁能把模型用好”的差距会越来越大。


一、先看宏观:性能差距在缩小,成本差距在拉大

数据来源 发现
Anthropic 任务越复杂,模型质量越关键——成功率随任务”时间跨度”急剧下降,长 horizon / agentic 工作流中模型能力成为硬约束
OpenAI 推理 token 消费年增 320×——企业正把模型推向更复杂领域
MIT(OpenRouter 5 个月数据) 开源模型发布时通常达到闭源 90% 以上性能且快速收敛;但闭源仍占约 80% 的 token 用量
McKinsey/Mozilla/McGovern(700 名技术负责人) 50%+ 组织已在技术栈某处用开源 AI,科技公司中升至 72%
Artificial Analysis 开源约 90% 性能,但 API 定价平均每 token 便宜 6 倍——成本差距扩大的速度,快于性能差距缩小的速度

一句话:开源正在无限逼近闭源,价格还便宜一个数量级。那企业为什么还用闭源?


二、Finding 1:42% 的企业用例,模型选择是”商品”

斯坦福的裁决数据(51 个实现):

结论 占比
商品(完全可互换) 42%
中等重要 39%
关键差异化 19%

反复出现的模式是:成功来自模型之外的一切——数据质量、流程文档、集成架构、变更管理——而不是模型本身。

“我们做过的最重要的事,是花大量时间在我们的 RAG 上,真正搞定我们的 chunking 策略。” ——专业服务公司总监

注意:这个”42% 商品化”还只是今天的数字。随着开源与闭源的能力差距快速收窄,书里明确预测:商品化类别会显著扩大。


三、Finding 2:商品化的边界,由”任务复杂度”划出

按认知需求把实现分成两类:

任务类型 特征 例子
常规任务(Routine) 重复、规则导向、成功标准明确 客服分流、文档搜索、营销内容、招聘筛选
高级任务(Advanced) 多步推理、领域专长、后果重大 复杂编码、合规分析、临床文档、agentic 工作流

互换性的天壤之别:

任务类型 视为完全可互换 视为关键差异化
常规任务 71% 0%
高级任务 18% 35%

商品化边界 = 任务复杂度。 常规任务里没有一家把模型当关键差异化;到了高级任务,35% 的企业认为模型选择决定成败。

“随着 LLM 越来越商品化,进入壁垒比传统上低得多了。” ——医疗 AI 公司高管


四、Finding 3:多模型策略,正在成为新常态

大多数实现不再押注单一供应商,而是同时用多个模型。常见三种形态:

1. 按任务路由(Task-specific routing) 分类用又快又便宜的小模型,生成/推理用更强的模型——成本差异可达 10 倍以上。小模型常常能本地运行,成本基本只是电费,还有隐私好处。

2. 冗余验证(Validation through redundancy) 同一查询跑两个不同模型,只有答案一致才接受。

“我们把它跑在两个不同的 RAG 模型上。如果得到相同答案,那就是好答案;如果两个模型不匹配,那就是坏答案。” ——专业服务公司项目负责人

3. 查询级优化(Query-based optimization) 在每个模型前面加一层智能评估与路由。

“我们建了一个多 LLM 网关,基于查询来求解成本、准确率、相关性、延迟。每次查询的目标是:这个结果需要深度搜索吗?还是迷你模型就够了?” ——科技公司运营主管


五、Finding 4:抽象层,正在成为竞争优势

最成熟的实现都包含模型抽象层:不重构系统就能切换模型,模型只是平台里可互换的组件。

一个典型例子:一家外卖配送公司在 OpenAI、Gemini、Claude 之上自建了 AI 聊天机器人,用抽象层在客户服务中实现了 90-95% 自动化,且不依赖任何单一供应商。

这批组织的共同哲学:模型在快速且不可预测地改进,与其押注单一供应商,不如构建能吸收任何来源改进的基础设施。

最高绩效的实现,把模型当作自己掌控的平台里可互换的组件。持久的优势在编排层,不在基础模型。


六、Finding 5:开源模型进场了,但只在”专业角色”

开源不是缺席,而是从特定功能切入——定制和控制的需求超过前沿能力需求的地方:

  • 专业任务:如命名实体识别(NER)这类窄任务
  • 安全功能:需要完全可见模型行为的场景
  • 初创产品:领域数据微调驱动初始架构

三家公司的三种选择,构成完整光谱:

公司 做法 逻辑
大型金融服务机构 核心客户功能用专有模型,信息安全用开源(如 NER) 需要定制和控制模型行为
网络安全厂商 整个产品基于 Llama 微调 “拿 Llama 当基础模型然后改它”——不以性能领先为目标,而以可控成本适配窄域
云原生软件公司 完全拒绝开源 “我们避开大部分开源/免费/未批准工具,云原生,不做本地自托管”——要企业级许可的安全与隐私保证

关键趋势:开源通过”专业、低风险”功能进入企业。问题不是”用不用开源”,而是支撑基础设施多快赶上,让开源能承担核心生产负载

  • 2026 年初中国开源模型的崛起(Qwen、Kimi、Minimax、GLM 等)大幅缩小了能力差距,同时保持显著成本优势
  • 在 OpenRouter(400+ 模型、400 万+ 用户的路由平台)上,token 量前 5 的模型中 4 个是中国开源——主要由 agentic 工作负载驱动(比传统聊天消耗指数级更多 token)
  • 但美国企业部署仍压倒性依赖 OpenAI、Anthropic、Meta Llama、Google Gemini——合规、支持、供应商认证是关键因素
  • 随着 agent 架构扩展,管理模型选择与推理成本(”tokenomics”)将成为技术团队的核心能力

七、Finding 6:今天的决策逻辑是”能力与速度”,不是成本

超过三分之二讨论模型选择标准的企业,把能力列为首要原因,而不是成本。企业选的是”最快交付结果”的模型,不是”最便宜”的模型。

总拥有成本(TCO)看,这完全合理:

“我们最终用 Claude 重写了同样的代码,取消了合同,有了自己的专有方案。” ——零售公司高管(先自建定制方案,后发现通用专有模型总投入更低)

两个重要补充:

  1. 数据主权不等于自托管。 多数企业没有部署本地模型,而是与云供应商谈判合同保护 + 数据最小化——主权通过合同解决,而非模型架构。
  2. “今天不为成本优化”很快会变。 token 饥饿的 agent 实现正在上升,推理成本可能成为模型选择的首要因素;小模型和开源模型追平前沿模型后,成本与技术独立性将主导选择。

八、案例:科技公司客户支持,打造”模型无关”基础设施

**通信科技 客户支持 企业级**

挑战:客户支持量增长快于招人速度。技术难点不是建聊天机器人,而是建一套能路由查询到最优模型、按成本/准确率/延迟优化、避免供应商依赖、并随新模型自动改进的基础设施。

解决方案:不选单一供应商,构建多 LLM 网关,把模型选择从应用层抽象出去——每个查询按四个维度优化:成本、延迟、相关性、准确性。

“我们不只用一种。我们用 Claude、OpenAI、一些 Llama——用不同的模型,有时也用 Bedrock。” ——科技公司运营主管

结果

指标 结果
工单拦截(ticket deflection) 82%
解决率(resolution rate) 71%
客服生产力 +40%+
客服人数 -32%

关键教训:业务成果来自规模化自动化,网关主要负责系统内的成本与延迟优化。它帮公司避开了三个架构陷阱:

  1. 供应商依赖——任何提供商的改进都能无缝采纳,无需重构
  2. 成本优化——按查询优化,而不是做一次性的全局”模型选择”
  3. 面向未来——模型变好、变便宜,基础设施自动吸收

常规客服查询,任何前沿模型都行;需要深度搜索或高准确率的复杂查询,自动路由到更强模型。系统持续自我优化,根本不需要任何人做一次”押注哪个模型”的战略决策。


九、五步行动清单:把”选模型”变成”搭平台”

  1. 先问”任务复杂度”,再问”哪个模型”。 常规任务直接当商品处理,随便选、随时换;把选型焦虑留给高级任务(复杂编码、合规分析、agentic 工作流)。
  2. 搭抽象层,而不是选供应商。 多 LLM 网关 / 抽象层让模型变成可互换组件——持久优势在编排层,不在模型。
  3. 用路由吃成本红利。 简单查询用小模型(可能差 10 倍成本),复杂查询才上强模型;用双模型冗余验证关键答案。
  4. 开源从”专业角色”开始试水。 NER、安全、微调驱动的窄域产品是低风险入口;不要一开始就指望开源承担核心生产负载。
  5. 监控 tokenomics。 agent 时代推理成本会从”次要”变”首要”——今天不为成本优化,不代表下个季度不用。

下次预告

到这里,手册的技术章节全部讲完。下一章是全书 Conclusion:51 个成功实现、41 家组织、9 个行业、7 个国家的研究,最终收敛成哪几条结论?——“技术是有效的。难的是其他一切。”