基于 Stanford《2026 企业 AI 实战手册》(The Enterprise AI Playbook) Chapter 9 学习笔记

开篇:那个”要清理两个月”的数据

一家专业服务公司的 VP 转述合作伙伴的话:”清理这些数据要花我们两个月,你们一天之内就把所有数据问题标记出来了。”

这句话戳破了企业 AI 圈流传最广的迷信:“AI 要跑起来,先得有干净数据。” 斯坦福对 51 个案例的数据告诉我们恰恰相反——只有 6% 的实现数据”完全就绪”,但 AI 非但没被脏数据卡死,还在 88% 的案例里解锁了以前根本用不了的数据

这一章的结论一句话:真正的数据挑战不是”干净”,而是”访问”和”存储”。 数据不用完美,但必须够得着、留得住。


一、先看宏观:干净数据确实是优势,但没人量化过”能多乱”

数据来源 发现
行业调查 规模化企业(Strategic Scalers)61% 拥有大型准确数据集,POC 卡壳公司只有 38%
McKinsey 高绩效者更可能创建”可复用、业务特定的数据产品”
OpenAI 企业结构化工作流(Custom GPTs/Projects)年增 19×,已处理约 20% 企业消息

已有的研究都证明”干净数据 = 成功”,但没有一个量化过”数据能多乱还能出结果”。斯坦福补上了这一刀。


二、Finding 1:LLM 不只是消费数据,它在修复数据

传统叙事说 AI 需要干净数据。数据反驳:

只有 6% 的实现数据完全就绪;绝大多数面临中到严重的数据问题。但在大多数情况下,LLM 本身就是这些数据问题的解药。

三个关键数字:

指标 数据 含义
非结构化数据处理 91% 的实现成功处理 语音转录、扫描件、图片、聊天日志、遗留代码——两年前全不可用
数据解锁 88% 解锁以前无法访问的数据 不是不存在,而是 OCR/规则引擎/手动标记做不到
数据完全就绪 6% 干净数据是例外,不是常态

以前非结构化数据要”人先上结构”才能分析,现在 LLM 直接啃。三类以前打不开的数据,现在全开了:

  • 语音和对话:医疗”环境转录”让编码团队第一次看见医患对话——”有了它,那个人能访问医疗护理中讨论的一切,医疗的审计性和可追溯性前所未有。”
  • 分散文档和知识库:半导体制造商用多智能体框架从 5-6 个仓库自动拉数据,数据收集时间减少 10 倍以上。”文档、数据表、测试库全不集中,各自归不同团队。”
  • 视觉和多模态:现场技术员拍张设备照片,AI 秒出维修指南;零售采购直接消化扫描的纸质表单、邮件和 Excel——以前要”成堆的手工录入员”。

三、Finding 2:流程文档和访问,比数据完美重要

数据架构的残酷现实:

59% 的实现数据分散在多个系统、归不同团队所有;只有 16% 完全集中。

但成功不要求集中,只要求访问

思路 前 LLM 时代 今天
数据要求 先结构化、先集中,再提取价值 检索层设计好,RAG 就能啃杂乱数据
集成方式 大规模数据湖/仓库建设 API、RAG 架构、多智能体框架、知识库连接器
结果 集成层方案与集中存储表现一样好 同上

电信公司的做法很有代表性:为不同设备类型建不同知识库、做索引,然后通过模型上下文协议(MCP)让 AI agent 直接访问——从头到尾没有集中过底层数据

“所有艰苦的工作都在流程文档和数据架构。这两件事做对了,其他一切都很简单。”——专业服务公司 VP of AI


四、Finding 3:专有数据是持久的护城河

每个前沿实验室都在用它能拿到的所有公开数据训练——组织没法在”谁的模型强”上竞争。但每家公司都有实验室从未见过、也不允许看的专有数据,那就是你的优势。

数据 意义
75% 的实现 把专有数据列为 AI 战略关键因素
47% 的实现 明确把积累的数据描述为竞争护城河

而且规律跨行业一致:从 AI 赚到最多钱的组织,是那些早在知道怎么用之前就开始存数据的公司——哪怕数据不完美。

“我们的差异化,人们买我们的原因,是我们过去 13 年建的这个知识图谱,超过 200 亿数据点。”——HR 科技公司高管 “力量来自利用独特资产:数据、专家、客户群、关系。差异化需要别人无法快速复制的东西。”——教育科技 CTO

含义非常直白:保存一切。 存储成本比起”正确用例到来时你没有数据”的代价,微不足道。而且随着开源模型逼近专有模型,差异化正在从”用哪个模型”转向”喂什么数据”。


五、实践建议与总结

四步行动清单:

  1. 别再等”数据干净”再上 AI。 只有 6% 的公司等到了。用 RAG + 知识库连接器直接啃现有数据,检索层设计好就够了——”数据有多乱”不再是拦路虎。
  2. 把精力花在流程文档和数据架构上。 这是专业服务公司 VP 口中”所有艰苦工作”所在——文档化流程、理清数据归谁管、打通访问路径,比花钱建集中数据湖更划算。
  3. 优先解锁三类”沉睡数据”。 语音/对话(转录、呼叫中心)、分散文档(多智能体聚合)、多模态(照片即文档)。88% 的解锁机会都在这里。
  4. 从今天开始存一切数据。 哪怕不知道将来怎么用。75% 的高价值案例靠专有数据,47% 视其为护城河——而开源模型正在抹平”模型差距”,喂什么数据将成为唯一的竞争维度

最后记住这一章的副标题,它就是全部答案:真正的数据挑战是访问和存储,不是干净。 数据不必完美,但要够得着、留得住。下一章看:企业怎么把 AI 的组织管理落地——中心化还是去中心化、治理怎么设计。


参考资料:Stanford Digital Economy Lab, “The Enterprise AI Playbook” (2026), Chapter 9: How clean does enterprise data actually need to be?