基于 Stanford《2026 企业 AI 实战手册》(The Enterprise AI Playbook) Chapter 11 学习笔记
开篇:选错模型,会不会输?
“我的关注点不是工具。我的关注点是构建一个平台——平台建好后他们就会用。如果某个模型变得更好或更便宜,你有在模型之间切换的灵活性。” ——科技公司运营主管
每次技术栈选型,团队都要吵一架:GPT 还是 Claude?Gemini 还是 Llama?开源还是闭源?买贵的怕浪费,买便宜怕不行,押错宝怕被供应商锁死。
这一章用 51 个案例给了个反直觉的答案:对 42% 的企业实现来说,选哪个模型根本不重要——它是可以随时替换的”商品”(commodity)。而真正把赢家和输家分开的,不是模型本身,是模型外面的那层东西:数据质量、流程文档、集成架构,尤其是编排层(orchestration layer)。
这一章一句话总结:模型会越来越便宜、越来越商品化,但”谁能把模型用好”的差距会越来越大。
一、先看宏观:性能差距在缩小,成本差距在拉大
| 数据来源 | 发现 |
|---|---|
| Anthropic | 任务越复杂,模型质量越关键——成功率随任务”时间跨度”急剧下降,长 horizon / agentic 工作流中模型能力成为硬约束 |
| OpenAI | 推理 token 消费年增 320×——企业正把模型推向更复杂领域 |
| MIT(OpenRouter 5 个月数据) | 开源模型发布时通常达到闭源 90% 以上性能且快速收敛;但闭源仍占约 80% 的 token 用量 |
| McKinsey/Mozilla/McGovern(700 名技术负责人) | 50%+ 组织已在技术栈某处用开源 AI,科技公司中升至 72% |
| Artificial Analysis | 开源约 90% 性能,但 API 定价平均每 token 便宜 6 倍——成本差距扩大的速度,快于性能差距缩小的速度 |
一句话:开源正在无限逼近闭源,价格还便宜一个数量级。那企业为什么还用闭源?
二、Finding 1:42% 的企业用例,模型选择是”商品”
斯坦福的裁决数据(51 个实现):
| 结论 | 占比 |
|---|---|
| 商品(完全可互换) | 42% |
| 中等重要 | 39% |
| 关键差异化 | 19% |
反复出现的模式是:成功来自模型之外的一切——数据质量、流程文档、集成架构、变更管理——而不是模型本身。
“我们做过的最重要的事,是花大量时间在我们的 RAG 上,真正搞定我们的 chunking 策略。” ——专业服务公司总监
注意:这个”42% 商品化”还只是今天的数字。随着开源与闭源的能力差距快速收窄,书里明确预测:商品化类别会显著扩大。
三、Finding 2:商品化的边界,由”任务复杂度”划出
按认知需求把实现分成两类:
| 任务类型 | 特征 | 例子 |
|---|---|---|
| 常规任务(Routine) | 重复、规则导向、成功标准明确 | 客服分流、文档搜索、营销内容、招聘筛选 |
| 高级任务(Advanced) | 多步推理、领域专长、后果重大 | 复杂编码、合规分析、临床文档、agentic 工作流 |
互换性的天壤之别:
| 任务类型 | 视为完全可互换 | 视为关键差异化 |
|---|---|---|
| 常规任务 | 71% | 0% |
| 高级任务 | 18% | 35% |
商品化边界 = 任务复杂度。 常规任务里没有一家把模型当关键差异化;到了高级任务,35% 的企业认为模型选择决定成败。
“随着 LLM 越来越商品化,进入壁垒比传统上低得多了。” ——医疗 AI 公司高管
四、Finding 3:多模型策略,正在成为新常态
大多数实现不再押注单一供应商,而是同时用多个模型。常见三种形态:
1. 按任务路由(Task-specific routing) 分类用又快又便宜的小模型,生成/推理用更强的模型——成本差异可达 10 倍以上。小模型常常能本地运行,成本基本只是电费,还有隐私好处。
2. 冗余验证(Validation through redundancy) 同一查询跑两个不同模型,只有答案一致才接受。
“我们把它跑在两个不同的 RAG 模型上。如果得到相同答案,那就是好答案;如果两个模型不匹配,那就是坏答案。” ——专业服务公司项目负责人
3. 查询级优化(Query-based optimization) 在每个模型前面加一层智能评估与路由。
“我们建了一个多 LLM 网关,基于查询来求解成本、准确率、相关性、延迟。每次查询的目标是:这个结果需要深度搜索吗?还是迷你模型就够了?” ——科技公司运营主管
五、Finding 4:抽象层,正在成为竞争优势
最成熟的实现都包含模型抽象层:不重构系统就能切换模型,模型只是平台里可互换的组件。
一个典型例子:一家外卖配送公司在 OpenAI、Gemini、Claude 之上自建了 AI 聊天机器人,用抽象层在客户服务中实现了 90-95% 自动化,且不依赖任何单一供应商。
这批组织的共同哲学:模型在快速且不可预测地改进,与其押注单一供应商,不如构建能吸收任何来源改进的基础设施。
最高绩效的实现,把模型当作自己掌控的平台里可互换的组件。持久的优势在编排层,不在基础模型。
六、Finding 5:开源模型进场了,但只在”专业角色”
开源不是缺席,而是从特定功能切入——定制和控制的需求超过前沿能力需求的地方:
- 专业任务:如命名实体识别(NER)这类窄任务
- 安全功能:需要完全可见模型行为的场景
- 初创产品:领域数据微调驱动初始架构
三家公司的三种选择,构成完整光谱:
| 公司 | 做法 | 逻辑 |
|---|---|---|
| 大型金融服务机构 | 核心客户功能用专有模型,信息安全用开源(如 NER) | 需要定制和控制模型行为 |
| 网络安全厂商 | 整个产品基于 Llama 微调 | “拿 Llama 当基础模型然后改它”——不以性能领先为目标,而以可控成本适配窄域 |
| 云原生软件公司 | 完全拒绝开源 | “我们避开大部分开源/免费/未批准工具,云原生,不做本地自托管”——要企业级许可的安全与隐私保证 |
关键趋势:开源通过”专业、低风险”功能进入企业。问题不是”用不用开源”,而是支撑基础设施多快赶上,让开源能承担核心生产负载。
- 2026 年初中国开源模型的崛起(Qwen、Kimi、Minimax、GLM 等)大幅缩小了能力差距,同时保持显著成本优势
- 在 OpenRouter(400+ 模型、400 万+ 用户的路由平台)上,token 量前 5 的模型中 4 个是中国开源——主要由 agentic 工作负载驱动(比传统聊天消耗指数级更多 token)
- 但美国企业部署仍压倒性依赖 OpenAI、Anthropic、Meta Llama、Google Gemini——合规、支持、供应商认证是关键因素
- 随着 agent 架构扩展,管理模型选择与推理成本(”tokenomics”)将成为技术团队的核心能力
七、Finding 6:今天的决策逻辑是”能力与速度”,不是成本
超过三分之二讨论模型选择标准的企业,把能力列为首要原因,而不是成本。企业选的是”最快交付结果”的模型,不是”最便宜”的模型。
从总拥有成本(TCO)看,这完全合理:
“我们最终用 Claude 重写了同样的代码,取消了合同,有了自己的专有方案。” ——零售公司高管(先自建定制方案,后发现通用专有模型总投入更低)
两个重要补充:
- 数据主权不等于自托管。 多数企业没有部署本地模型,而是与云供应商谈判合同保护 + 数据最小化——主权通过合同解决,而非模型架构。
- “今天不为成本优化”很快会变。 token 饥饿的 agent 实现正在上升,推理成本可能成为模型选择的首要因素;小模型和开源模型追平前沿模型后,成本与技术独立性将主导选择。
八、案例:科技公司客户支持,打造”模型无关”基础设施
| **通信科技 | 客户支持 | 企业级** |
挑战:客户支持量增长快于招人速度。技术难点不是建聊天机器人,而是建一套能路由查询到最优模型、按成本/准确率/延迟优化、避免供应商依赖、并随新模型自动改进的基础设施。
解决方案:不选单一供应商,构建多 LLM 网关,把模型选择从应用层抽象出去——每个查询按四个维度优化:成本、延迟、相关性、准确性。
“我们不只用一种。我们用 Claude、OpenAI、一些 Llama——用不同的模型,有时也用 Bedrock。” ——科技公司运营主管
结果:
| 指标 | 结果 |
|---|---|
| 工单拦截(ticket deflection) | 82% |
| 解决率(resolution rate) | 71% |
| 客服生产力 | +40%+ |
| 客服人数 | -32% |
关键教训:业务成果来自规模化自动化,网关主要负责系统内的成本与延迟优化。它帮公司避开了三个架构陷阱:
- 供应商依赖——任何提供商的改进都能无缝采纳,无需重构
- 成本优化——按查询优化,而不是做一次性的全局”模型选择”
- 面向未来——模型变好、变便宜,基础设施自动吸收
常规客服查询,任何前沿模型都行;需要深度搜索或高准确率的复杂查询,自动路由到更强模型。系统持续自我优化,根本不需要任何人做一次”押注哪个模型”的战略决策。
九、五步行动清单:把”选模型”变成”搭平台”
- 先问”任务复杂度”,再问”哪个模型”。 常规任务直接当商品处理,随便选、随时换;把选型焦虑留给高级任务(复杂编码、合规分析、agentic 工作流)。
- 搭抽象层,而不是选供应商。 多 LLM 网关 / 抽象层让模型变成可互换组件——持久优势在编排层,不在模型。
- 用路由吃成本红利。 简单查询用小模型(可能差 10 倍成本),复杂查询才上强模型;用双模型冗余验证关键答案。
- 开源从”专业角色”开始试水。 NER、安全、微调驱动的窄域产品是低风险入口;不要一开始就指望开源承担核心生产负载。
- 监控 tokenomics。 agent 时代推理成本会从”次要”变”首要”——今天不为成本优化,不代表下个季度不用。
下次预告
到这里,手册的技术章节全部讲完。下一章是全书 Conclusion:51 个成功实现、41 家组织、9 个行业、7 个国家的研究,最终收敛成哪几条结论?——“技术是有效的。难的是其他一切。”