# 企业AI实战手册

**来自51个成功部署案例的经验教训**

*Elisa Pereira, Alvin Wang Graylin 和 Erik Brynjolfsson*

*斯坦福数字经济实验室 · 斯坦福大学 · 2026年4月*

---

## 前言

如今关于人工智能的预测和情绪调查层出不穷。每周都有新的预测和辩论：AI是否有用，哪些工作会消失，哪些行业会转型，哪些公司会占据主导地位。但当我们与真正在组织内部部署AI的高管交谈时，我们听到的是另一组问题。不是五年后可能发生什么，而是现在正在发生什么——实际现实，而非抽象框架。

本报告源于一个简单的信念：关于AI采纳的最有价值的洞见不在假设或预测中，而在那些已经走过这条路的人的经验模式中。

我们着手构建一些实证性的东西。记录真正交付了商业价值的真实用例。绘制那些不仅在试验AI、而且成功大规模部署AI的组织的实践图谱。我们追求深度——去理解那些不会出现在新闻稿中的陷阱，区分成功试点和失败试点的细微差别，以及任何供应商白皮书都不会告诉你的组织现实。

在5个月内的51个企业案例中，我们发现了以周为单位衡量的转型故事，也有以年为单位的转型故事。相同的技术，相同的用例，截然不同的结果。差异从来不在于AI模型，而始终在于组织——其准备程度、其流程、其领导力、其改变和失败的意愿。

我们这项研究的目标很简单：提供一个实际的窗口，了解企业在用AI创造价值时实际正在发生什么，包括详细的公司案例研究。只有首先理解工作的现在，才能理解工作的未来。

在结论中，我们基于AI领域的未来趋势提供了一些前瞻性洞见。我们希望这些发现既能作为一面镜子，也能作为一张地图——反映你的组织可能所处的位置，并照亮你如何自信前进的道路。

*Elisa Pereira, Alvin Wang Graylin & Erik Brynjolfsson*
*研究团队*
*斯坦福数字经济实验室*

---

## 贡献者

### Elisa Pereira
斯坦福数字经济实验室研究员 · 斯坦福商学院MSx候选人

Elisa Pereira是斯坦福数字经济实验室的研究员和斯坦福商学院的MSx候选人，拥有风险投资背景和在拉丁美洲构建数十个企业AI解决方案的实践经验。她目前的研究重点是衡量这些部署的真实影响，识别成功实施背后的模式，以及探索拉丁美洲如何建立技术主权。

### Alvin Wang Graylin
斯坦福数字经济实验室数字研究员 · 斯坦福大学

Alvin Wang Graylin是斯坦福数字经济实验室的数字研究员，也是一位作家、连续创业者和技术高管，在AI、XR、网络安全和半导体行业拥有超过35年的经验。他目前是虚拟世界协会主席、亚洲社会政策研究所CCA高级研究员、MIT讲师，并为政府、组织和技术转型提供咨询。他的著作《我们的下一个现实》讨论了AI和沉浸式技术将如何在未来十年重塑我们的世界。他目前的研究重点是AI经济学以及确保向后劳动力经济模式平稳过渡所需的相关政府政策。

### Erik Brynjolfsson
斯坦福数字经济实验室主任 · 斯坦福大学教授

Erik Brynjolfsson是斯坦福数字经济实验室主任，斯坦福人类中心AI研究所(HAI)的Jerry Yang和Akiko Yamazaki教授及高级研究员。他还是SIEPR的Ralph Landau高级研究员，斯坦福商学院和经济学系的兼职教授，以及美国国家经济研究局(NBER)的研究员。作为信息经济学被引用最多的作者之一，他合著了数百篇文章和书籍，包括《第二个机器时代》和《机器、平台、群体》。他通过Workhelix将其学术洞见付诸实践，这是一家他联合创办的公司，用于识别和衡量AI的收益。

---

## 宏观背景

### 为什么企业AI实施现在很重要

AI等通用技术能够并需要在流程再造、劳动力发展和组织重构方面进行大量补充投资。这些投资大多是无形的，在国民经济核算中衡量不足，这意味着在新技术的早期阶段，生产率增长被系统性地低估，而在后期收获收益时则被高估。Brynjolfsson、Rock和Syverson（2021）将这些观察形式化为一个名为**"生产率J曲线"**的模型。[1]

宏观经济结果不取决于技术本身，而取决于组织如何部署它。我们面临一个**"生产率分岔口"**：AI可以增强工人并创造新能力，也可以主要自动化现有任务并削减人员编制。所选择的道路将塑造未来几十年的经济增长。[2] 具体而言，自动化会使工人从现有任务中被取代，但创造人类具有比较优势的新任务可以恢复劳动力需求。[3] AI是带来广泛繁荣还是集中收益，取决于组织是否能产生足够的新机会来抵消劳动力替代。[4]

一些就业影响已经开始显现。对覆盖数百万美国工人的高频工资单数据的分析发现，AI暴露职业中的早期职业工人就业相对下降了16%，22至25岁的软件开发者下降了近20%。[5] 这些"煤矿中的金丝雀"表明，许多人预期的一些劳动力市场扰动已不再是假设。

这些衡量挑战不仅仅是学术性的。GDP等标准指标系统性地无法捕捉新的免费数字商品的福利贡献。他们的GDP-B框架衡量的是消费者收益而非生产成本，揭示了数字经济中大量未被衡量的价值创造。[6] 如果汇总统计数据低估了相对简单的数字服务的收益，那么它们很可能遗漏了更多AI在组织内部创造的价值——而这恰恰是本报告试图记录的那种价值。AI代理系统为软件开发者带来的一种新的非货币福利是"自由时间"来思考。当AI代理自主构建越来越大的代码部分时，人类编码者被分配了更多的咖啡休息时间来思考更大的问题。这不会出现在标准的生产率衡量中，但这是一个真实的福利，改善了他们的日常工作。

这些宏观发现与组织内部发生的事情之间存在显著差距。经济模型描述的是汇总效应。企业层面的实验衡量的是更受控的环境。两者都没有捕捉到跨部门部署AI、克服阻力、以及构建J曲线框架认为必不可少的补充基础设施的混乱运营现实。这正是我们的研究所填补的空白。

### 为什么做这项研究

尽管企业AI支出达数十亿美元，但2025年MIT NANDA计划的一项研究得出结论，**95%的生成式AI试点项目未能产生可衡量的财务影响**。[7] 他们认为失败不是源于模型质量，而是源于工作流整合不善和组织激励不一致。这是技术能做到的与组织设法用它做到的之间的差距。

相比之下，我们的目标是了解AI成功部署的案例。我们深入研究了企业，分析了51个企业AI交付可衡量价值的案例。这些组织做了什么不同？整合的实际成本是多少？阻力来自哪里，最重要的是，它是如何被克服的？

### 我们如何纳入失败

虽然本报告聚焦于交付了可衡量价值的实施案例，但我们并非孤立地研究成功。在每次访谈中，我们明确要求参与者描述在当前结果之前的失败、错误开始和放弃的试点。我们问他们先尝试了什么，为什么没有成功，以及他们改变了什么。

出现的不是一个组织避免困难的故事。而是一个组织通过迭代失败并建立系统方法来克服初始挫折的故事。我们调查的公司中有三分之二在实现价值创造之前有过重大的失败尝试。本报告中的模式反映了这些组织从过程中学到的东西，与通过成功实现的东西一样多。

我们要透明地说明，这确实带有一个已知的局限性：对正面结果的选择偏差。我们的发现描述了成功是什么样子以及达到成功需要什么；我们并不声称提供了关于成功在整个经济中有多普遍的代表性数据。

> "所有幸福的家庭都是相似的；每个不幸的家庭都有各自的不幸。" – 列夫·托尔斯泰

---

## 方法论

本研究基于对已大规模部署AI解决方案的高管和项目负责人的深度访谈。我们只关注已超越试点阶段并正在交付可衡量商业价值的计划。

### 研究样本概况

我们的51个案例研究来自41个组织、7个国家、5个地区，代表超过100万名员工（附录中有完整的匿名公司列表）。

### 选择标准

四个维度定义了我们选择分析的成熟AI项目：

- **运营稳定性**：系统已上线，集成到真实工作流中，并在生产中持续使用。
- **持续的业务采纳**：跨职能团队在数月内（3个月以上）积极依赖AI系统进行决策。
- **量化的价值创造**：明确的业务成果，如生产率提高、收入增长或客户满意度。
- **可扩展性和可复制性**：可以跨团队、地区或业务单元扩展或复制。

技术范围从数据科学模型（机器学习、深度学习）到代理式工作流。

### 访谈方法

每个案例研究通过每个公司至少一次结构化的60分钟访谈开发，遵循一致的讨论框架。我们用参与公司提供的书面文件补充了访谈数据，包括内部指标/报告、项目计划/审查和财务更新。访谈在2025年8月至2026年2月之间进行。

### 评分标准

每个维度基于记录的证据进行评分：
- 3 = 强（满足所有标准）
- 2 = 中等（满足大多数标准）
- 1 = 弱（满足很少标准）

我们要求来自系统、文档或指定负责人的证据。

### 样本构成

我们的样本跨越9个行业，在制造业、金融服务和技术领域有特别的深度。分布反映了当前企业AI采纳的格局。

### 局限性

本研究主要依赖于访谈参与者的自我报告数据。虽然我们在可能的情况下进行了三角验证，并专注于有记录结果的成熟计划，但读者应考虑对成功部署的潜在选择偏差。

我们的样本虽然多样，但不代表所有企业AI计划。技术和金融服务行业的集中度反映了早期采纳模式，而非AI部署的全貌。

所有数据都经过匿名化和汇总处理，以保护专有信息并遵循受试公司的披露政策。具体的公司名称和识别细节已被删除或泛化。

---

## 关键发现摘要

1. **技术不是最难的部分。** 77%的最困难挑战是看不见的无形成本：变革管理、数据质量和流程再造。61%的成功项目至少包含一次先前失败的成本，这些成本从未出现在最终ROI中。

2. **时间差异是组织性的，而非技术性的。** 相似用例在一家公司耗时数周，在另一家耗时数年。差异在于高管支持、现有组织流程和终端用户意愿。

3. **升级模式与更好的结果相关。** 升级模式（AI自主处理80%以上，人类审查例外）实现了**71%的中位生产率提升**，而审批模式为30%。这部分可能反映了所处理任务类型的不同。

4. **高管支持关乎行动，而非审批。** 有效的支持者每周清除障碍，连接业务和技术团队，并将AI采纳与企业OKR挂钩。最关键的是，他们创造了一种允许失败的文化。

5. **职能部门是最常见的阻力来源，但获得认同后某些部分可能成为推动者。** 法律、人力资源、风险和合规是最常见的阻力来源，占35%，领先于内部终端用户的23%。

6. **人员削减很常见但并非不可避免。** 人员削减是45%部署的最大结果，但替代方案（避免招聘、重新部署、无削减）合计占55%。更广泛的劳动力市场数据表明，AI暴露职业的入门级职位已经在下降。

7. **来自AI的收入是真实的，但仍然罕见，遵循三种模式。** 转化的个性化、赢得交易的速度，以及重新打包为产品的内部工具。一小部分案例还显示AI使以前不可能的工作成为可能。

8. **代理式AI有效，但大多数组织尚未使用。** 代理式实施实现了71%的中位生产率提升（高自动化为40%），但仅占案例的20%。代理式AI不是新的用户界面；它是工作流中人与机器角色的重新定义。

9. **杂乱的数据不是障碍——如果你围绕它设计。** LLM解决了许多它们本应难以处理的数据问题。存储一切，连接一切，让模型来做清洗。

10. **安全的促进作用大于阻碍作用。** 在我们研究的任何案例中，安全都不是项目杀手。最初是障碍的要求后来使项目能够处理敏感数据。

11. **模型选择对许多用例来说是商品化的。** 42%的实施中，模型选择完全可以互换。公司并不总是需要最好的AI模型。持久的优势在编排层，而不在基础模型。

---

## 第一章：为什么AI商业案例低估了真实投资？

*决定成功或失败的隐藏成本*

### 已发表的研究发现

**扩展需要大量的非模型投资。** 麦肯锡的研究发现，高绩效AI组织（将>5%的息税前利润[EBIT]归因于AI的组织）更有可能投资于"重新布线"业务流程和数据产品，而不仅仅是模型部署。[8]

**"概念验证工厂"代表沉没成本。** 埃森哲估计80-85%的公司困在"概念验证工厂"阶段，它们进行实验但实现低回报和低扩展成功率。[9]

**数据基础设施是主要支出项。** 战略扩展者拥有大型准确数据集的可能性（61%对非扩展者的38%）远高于非扩展者，并在数据质量、管理和治理框架方面进行大量投资。

**生产率J曲线意味着隐藏投资。** 早期研究发现，每1美元的有形技术投资，公司最多花费10美元用于无形资产（流程再造、技能再培训、组织转型），最初会压低生产率，直到收益实现。[1]

### 我们的发现

从业者面临的77%的最困难挑战是看不见的成本：变革管理、数据质量和流程再造，而非技术问题。技术一直被描述为最简单的部分。成功部署的真实成本通常至少包括一次失败尝试，投资的大部分流向了模型以外的一切。

### 发现1：77%的最困难挑战是"看不见的成本"

当我们问从业者"最难修复的是什么？"时，答案揭示了AI预算的实际去向。

**最难挑战分类**：
- 数据质量与架构：17%
- 流程再造：10%
- 质量与准确性：10%
- ROI/商业案例：7%
- 技术/集成：10%
- 治理/合规：7%
- 供应商/平台：6%
- 隐形成本合计：**77%**
- 技术/可见成本合计：**23%**

> "所有艰苦的工作都在流程文档和数据架构中。如果你能做好这两件事，其他一切都相当简单。" — 电信公司高管

> "技术不是瓶颈——组织采纳才是失败点。" — 专业服务公司高管

### 发现2：61%的组织在当前成功之前有过失败的AI项目

这些失败的实验代表了从未出现在"成功"项目ROI中的沉没成本：

- 有先前AI失败：**61%**
- 无先前失败：**39%**

这些失败的实验是沉没成本，可能永远不会出现在成功项目的ROI中，但通常对成功至关重要。失败有一个共同模式：团队将AI视为技术项目，而非流程和变革管理项目。当应用于破碎的工作流时，当由没有业务所有权的技术团队领导时，或者当组织假设模型会修复需要重新设计工作本身的问题时，第一次尝试就会失败。

> "这实际上是他们第二次在招聘流程中寻求AI。最初失败是因为他们没有考虑到筛选算法中的偏见，他们以为AI会修复流程而不需要流程再造。" — 专业服务公司AI项目负责人

> "你对数据投入越多，就能从这些AI解决方案中获得更好的结果。" — 技术公司经理

> "问题不在模型。" — 专业服务公司高管

对预算的启示：成功AI部署的真实成本通常至少包括一次失败尝试，投资的大部分流向了模型以外的一切。

### 案例研究：物流公司的发票处理

**公司**：一家管理大型冷藏拖车车队的10亿美元以上美国物流公司。公司每年从全国各地执行拖车维护的供应商收到10万+张发票——从换轮胎到传感器更换。

**挑战**：发票的数量和种类造成了巨大的运营负担。七名全职员工专门负责此任务：合并发票、将它们与内部模板匹配、验证工作、将数据输入企业资源规划(ERP)系统以及生成客户发票。

> "他们通过不同渠道收到所有这些发票，包括传真。他们可能接到电话。很多这些修理店在偏远地区，他们只是打电话来说，嘿，我们做了这个修理。所以可能是电话，可能是邮件，可能是他们获得这些信息的各种方式。" — 技术服务公司高级高管

**看不见的工作**：
- **流程简化**：数千个模板减少到数百个。多年积累的发票模板是冗余和不一致的。在任何AI工作之前需要进行此清理。
- **数据标注**：主题专家(SME)审查了数千个AI输出。他们在日常工作之上验证AI生成的发票，向模型解释每一个错误。
- **高管支持**：总裁参与每周签到。这消除了瓶颈并确保了运营团队的认同。
- **知识转移**：两名初级IT人员从第一天起就嵌入。每日站会、每周和每月审查。没有黑箱——公司可以独立操作系统。

**解决方案**：公司构建了一个系统，自动读取发票（无论它们如何到达），理解其内容，并将数据直接输入公司的财务系统，消除了手动处理的需要。技术实现使用Azure Document Intelligence与Azure OpenAI Service，结合光学字符识别(OCR)解析和基于大语言模型(LLM)的语义映射。系统从多个渠道（电子邮件、传真、电话转录）摄取发票，使用OCR解析和提取数据，将发票内容映射到简化的模板分类法，并将验证后的数据直接写入MS Dynamics D365。

**结果**：
- 人员编制：7 → 2名全职等效员工(FTE)
- 准确率：85%
- 处理时间：< 24小时
- 投产时间：8周
- 创造价值：> 100万美元

**关键教训**：

> "一切都始于人。有人、流程和技术——我知道是这个顺序，尽管我代表的是一家技术公司。技术是最简单的部分。我们基本上使用了大量开源和现成的东西。" — 技术服务公司高级高管

> "听着，80%对我们来说就是完美的。我们可以把这些人放到另一个瓶颈上。我知道你可以继续改进，总有一天模型会达到95%，但我们不在乎。我们在乎的是立即节省成本和消除这些积压。" — 物流公司总裁

---

## 第二章：如何跨越部署到ROI之间的死亡谷？

*相似用例中数周与数年的差异*

### 已发表的研究发现

**有意设定时间表胜过"快速行动"。** 埃森哲得出结论，成功的AI扩展者设定1-2年从试点到扩展的时间表的可能性高65%。与"快速行动"的理念相反，他们对负责任地扩展所需的时间更加有意。[9]

**高绩效者重新设计工作流，而非仅仅部署工具。** 麦肯锡报告称，顶级绩效者从根本上重新设计工作流作为其AI工作一部分的可能性是其他公司的近三倍。55%的高绩效者围绕AI重新设计了工作流，而其他公司只有20%。[11]

**大多公司困在试点模式。** 虽然88%的组织在至少一个职能中使用AI，但只有三分之一开始在企业层面扩展其AI项目。三分之二仍处于测试或概念验证阶段。

### 我们的发现

相似用例耗时数周还是数年取决于组织。我们识别出三个一致加速项目的因素——高管支持、现有基础和终端用户意愿——以及四个减缓项目的因素。样本中的每个成功项目都使用了迭代方法。

### 发现1：差异是巨大的

一家大型金融科技公司使用AI编码代理将数百万行遗留ETL代码迁移到现代架构。项目耗时数周。一家技术公司用AI重新设计了他们的客户支持系统，六个月内上线。一家尝试相同客户支持用例的大型银行报告项目需要多年。

> "在AI代理上线的几周内，我们就识别出了以工程工时的一小部分加速迁移的明确机会。" — 金融科技公司高管

> "我们甚至需要多年才能启动其中一个。" — 金融服务公司高管

相同的用例，相同的AI模型，截然不同的时间表。这里的洞察不是中位数或平均值，而是组织背景比技术本身更重要。

### 发现2：三个因素一致加速价值实现时间

| 加速因素 | 频率 |
|---|---|
| 高管支持 | 43% |
| 在现有基础上构建 | 32% |
| 终端用户意愿 | 25% |

**在现有基础上构建**。利用现有基础设施或平台的项目移动得明显更快。一家技术公司因为已经为客户支持开发了AI平台，在几个月内就构建了他们的销售副驾驶。

> "我们在4月推出了第一个MVP[最小可行产品]。因为我们提前完成了客户支持项目，我们就继续构建了这个。" — 技术公司高管

**终端用户意愿**。当用户真正想要解决方案时，采纳摩擦消失了。在医疗保健领域，医院系统采纳了环境AI转录，尽管ROI不明确，只因为医生迫切需要缓解。使用现有流程，经过一整天工作后，他们被迫花数小时记录他们的日常活动。

> "当前医疗实践的状态如此糟糕，医生如此疲惫，以至于医院系统愿意尝试任何东西作为孤注一掷，看看是否能有所改变。" — 医疗AI公司高管

### 发现3：四个因素一致减缓项目

| 减速因素 | 频率 |
|---|---|
| 学习曲线和迭代 | 25% |
| 数据质量和准备 | 21% |
| 监管和合规 | 21% |
| 流程文档缺口 | 21% |

数据质量是一个反复出现的主题。监管约束在金融服务中造成了结构性延迟，合规要求无论技术准备程度如何都会延长时间表。

> "大多数客户在维护其知识库方面做得不好。" — 软件公司高管

### 发现4：每个成功项目都使用了迭代方法

在我们能够识别开发方法论的案例中，**100%使用了迭代方法**。没有使用传统瀑布式规划的。模式一致：从小开始、学习、扩展。

> "把它想象成一个分层蛋糕。我们构建一个流程，记录它，然后构建代理的那一层，然后是第二个和第三个功能。" — 物流公司高管

> "可能90%的试点和测试会失败，但我们会在上面迭代直到找到它们，然后它就增长再增长。" — 食品配送公司高管

### 案例研究：翻译服务公司的招聘

**公司**：他们的招聘流程已成为最大的成本消耗和业务可扩展性的战略瓶颈：缓慢的候选人入职、高流动率、难以配备小众语言和方言的人员，以及不一致的筛选质量限制了公司的增长速度。

**第一次尝试——以及为什么失败**：这是公司第二次将AI用于招聘。第一次失败有两个原因：没有考虑到筛选算法中的偏见，以及他们假设AI会修复破碎的流程而没有解决底层的工作流问题。

> "他们以为AI会修复流程，而不是也退后一步确保一切按预期工作。" — 专业服务公司高管

**第二次改变的三件事**：

首先，CEO亲自负责，而不是委托给CTO。项目有高管可见性和每周签到，可以快速清除瓶颈。

其次，他们在应用AI之前修复了流程。他们映射了整个招聘工作流并识别了真正的痛点在哪里。

第三，他们针对了真正的痛点。招聘人员不是轻微不便，而是被每天淹没团队的申请流压垮了，而且不断累积。

> "对那些人来说，这是止痛药。不是'嘿，这会很棒'，而是'我要淹死了。'" — 专业服务公司高管

**解决方案**：团队构建了一个AI驱动的招聘管道，具有按语言和方言的超个性化筛选、自动第一轮视频面试（带有偏见缓解评估），以及将招聘结果连接回筛选标准的反馈循环。系统学习了哪些候选人信号预测成功。

**结果**：
- 构建时间：约1个月
- 每个职位时间：3小时 → 3分钟
- 入库效率：+83%
- 筛选效率：+79%
- 候选人转化率：+75%

**关键教训**：相同的公司、相同的职能、相同的目标——但截然不同的结果。第一次尝试失败。第二次花了一个月并交付了83%的效率提升。差异不在于技术。

在应用AI之前修复流程。AI放大它所应用的任何流程。如果流程是破碎的，AI会让它更快地变糟。

针对真正的痛点。采纳很容易，因为用户迫切需要缓解。招聘团队不需要被说服——他们需要被拯救。

---

## 第三章：多少人类监督是最优的？

*审视AI实施中的人类参与*

### 已发表的研究发现

**企业和个人使用模式不同。** Anthropic的经济指数发现，52%的个人Claude.ai使用涉及人机协作，45%是完全自动化。企业API使用显示相反：77%自动化。这表明企业部署AI的方式与个人不同，但最优平衡仍不清楚。[10]

**结构化的人类监督与成功相关。** 麦肯锡报告称，65%的AI高绩效者定义了人在环流程来确定模型输出何时需要人类验证，而其他组织只有23%——相差近三倍。[11]

### 我们的发现

升级模式（AI自主处理80%以上，人类仅审查例外）实现了最高的生产率提升，中位数为71%。这部分反映了任务选择：升级模式通常应用于高容量、可恢复的任务，而审批和协作模式服务于受监管或高风险的工作。人类监督水平取决于错误容限、监管要求和任务复杂度，通常是一个战略设计选择而非限制。

### 发现1：适中的人类监督与最高的生产率提升相关

我们根据人类参与水平将每个案例分为三级：

| 人在环级别 | 描述 |
|---|---|
| 升级 | AI自主处理80%以上；人类仅审查例外或≤20%的样本 |
| 审批 | AI完成工作；人类在行动前审查并批准每个输出 |
| 协作 | 人类和AI在每个任务上持续合作 |

**按监督模式的生产率提升**：
- 升级（AI处理80%+）：中位数71%，平均数80%
- 审批（人类审查所有）：中位数30%，平均数43%
- 协作（一起工作）：中位数22%

> "90%或95%现在由代理完全自动化。如果有人说他们的食物没到或订单出了问题，90%到95%是完全自动化的。" — 食品配送公司AI负责人

### 发现2：最优监督级别因职能而异

适当的人类监督水平（HITL——人在环）取决于错误容限、监管要求和任务复杂度。

| 职能 | 典型HITL级别 | 平均收益 |
|---|---|---|
| IT运维 | 升级 | 90% |
| 客户支持 | 升级 | 71% |
| 理赔处理 | 升级 | 50% |
| 现场服务 | 审批 | 80% |
| 临床文档 | 审批 | 66% |
| 编码 | 协作 | 54% |

在客户支持领域，一家技术公司通过围绕AI优先解决重新设计工作流实现了82%的工单转移。在临床文档领域，医生必须批准每个AI生成的笔记，因为这些是法律文件。在编码领域，工程师从编写代码转变为审查AI生成的更改。

> "工程师不再需要完成整个迁移任务，他们只需审查更改，做小幅调整，然后合并他们的PR[拉取请求]。" — 拉丁美洲金融科技公司工程负责人

### 发现3：人类监督明显是正确选择的时候

人类监督不是AI不成熟的标志。在许多情况下，它在战略上是正确的设计选择。出现了四种人类参与创造明确价值的模式：

**零容错**。当一个错误的成本超过数千个正确输出时，人类审查是必不可少的。主要品牌的营销内容、法律文件和面向客户的通信属于此类别。

> "我不能运行有错误的活动。我不能运行一个将触达数百万客户的大型活动，存在不确定性。" — 企业AI公司战略负责人

**监管要求**。在医疗保健、金融和其他受监管行业，无论AI能力如何，人类审查都是法律强制的。问题不是AI能否做这项工作，而是监管机构是否会接受AI做这项工作。

> "医生审查它，批准它，然后发送回EMR[电子病历]。由于法律要求，医生仍必须审查每个笔记。" — 医疗AI公司高管

**企业风险管理**。大型组织更喜欢人在环解决方案，即使完全自动化在技术上是可行的。自主AI的感知风险超过了效率收益。

**持续改进**。人类审查者识别AI错误中的模式，反馈到模型改进中。这种反馈循环以完全自动化系统无法匹配的方式加速学习。

### 案例研究：金融服务公司的营销内容

**公司**：一家金融服务公司面临内容瓶颈。他们拥有支持超个性化的客户数据，但无法快速生成内容来利用它。传统代理工作流每次活动需要七周。

**解决方案**：他们部署了一个AI平台，生成多渠道内容同时保持品牌一致性。团队选择了80/20模式：AI处理80%的生成，人类提供20%的精炼和质量保证。随着技术和经验学习的成熟，AI承担的比例最终将趋向100%。

**人类监督如何促成成功**：这个划分是深思熟虑的。企业营销不能容忍面向客户内容的错误。

> "要在企业层面运行，你需要80%的技术和20%的人类精炼。AI行业还没有达到可以完美完成那最后20%的水平。" — 企业AI公司战略负责人

人类层服务于三个功能：
- **品牌保护**——防止会损害多年品牌建设的错误
- **边缘情况处理**——需要判断的不寻常组合
- **反馈循环**——审查者识别改进AI输出的模式

**结果**：
- 上市时间：7周 → 6小时
- 点击率：提升2倍
- 生产效率：时间减少>80%

**关键教训**：人类监督不是对生产率的征税。80/20模式在保持零容错的同时实现了97.6%的上市时间减少。监督水平应与风险相匹配。公司将20%的人类成分视为过渡性的，期望随着AI改进而减少，但他们从有效的东西开始，而不是等待完美的自动化到来。

---

## 第四章：推动结果的支持者与仅仅审批预算的支持者有何不同？

*定义有效高管支持的活动*

### 已发表的研究发现

**与绩效高度相关。** 麦肯锡报告称，AI高绩效者同意高级领导者展示对AI计划的所有权和承诺的可能性是其他公司的3.0倍。[11]

**冠军人物很重要。** 埃森哲发现，战略扩展者通常由首席AI、数据或分析官冠军推动，而挣扎中的公司依赖技术部门内的单一冠军。[9]

**有意性高于存在。** 扩展者推动AI锚定在C级目标中；概念验证工厂缺乏与战略要务的连接。

上述研究建立了相关性，但没有解决支持者实际做了什么使结果不同。

### 我们的发现

**主动引导**（每周签到、主动清除障碍）是成功项目中最常见的模式。但实现全组织转型的七个案例都达到了**战略整合**：支持者将AI采纳制定为与奖金挂钩的企业目标和关键结果(OKR)，而不仅仅是一个需要支持的项目。当我们超越支持者做了什么去看他们如何领导时，出现了一个一致的模式：最有效的支持者创造了团队可以失败、学习并在没有职业后果的情况下再次尝试的条件。关键不在于高管本身，而在于他们创造了一种鼓励实验、要求协作、设计问责制并培养主动不受惩罚的安全环境的企业文化。

### 发现1：主动引导很常见，但战略整合推动转型

我们将支持者参与分为四级：

| 级别 | 含义 |
|---|---|
| 1 被动审批 | 批准预算，完全委托，很少持续参与 |
| 2 定期监督 | 月度审查，升级时清除障碍，被动反应 |
| 3 主动引导 | 每周签到，主动清除障碍，参与决策 |
| 4 战略整合 | AI纳入企业OKR，激励与采纳挂钩，文化变革 |

| 参与级别 | 百分比 |
|---|---|
| 定期监督（2级） | 12% |
| 主动引导（3级） | 58% |
| 战略整合（4级） | 29% |

主动引导对单个职能内的项目有效。但实现全组织转型的七个案例都达到了战略整合：支持者将AI采纳作为组织成功的衡量标准，而不仅仅是一个需要支持的项目。

### 发现2：四项活动定义了有效支持者所做的事

| 活动 | 案例占比 | 具体表现 |
|---|---|---|
| 资源分配 | 59% | AI专用预算、人员、基础设施 |
| 战略整合 | 49% | AI与业务目标和OKR连接 |
| 组织沟通 | 32% | 在组织内传达AI重要性 |
| 障碍清除 | 20% | 在升级前主动清除障碍 |

资源分配是基本要求。区分有效支持者的是他们在预算之外所做的事情：将AI连接到业务目标，在组织内传达其重要性，最关键的是，在团队不得不升级之前主动清除障碍。

> "总裁紧盯着它，每周签到：进展如何，我们在哪里，瓶颈是什么？这很有帮助，因为团队其他成员也参与了。" — 技术服务公司高级高管

### 发现3：业务+技术共同赞助解锁跨职能项目

八个案例显示，业务和技术领导者之间的共同赞助是关键所在。在一家专业服务公司，第一次AI推动尝试由CTO领导，但未能获得关注。当CEO和人才负责人与CTO一起推动时，第二次尝试成功了：

> "组织必须知道这是CEO主导的事情，不仅仅是CTO。当AI是技术主导和技术优先时，它不起作用或很少起作用。" — 专业服务公司高管

CEO提供了战略授权。人才负责人定义了激励和成功指标。CTO负责实施。每个人都带来了其他人缺乏的东西。

在一家电信公司，成功来自于找到了一个连接两个世界的领导者：

> "最大的推动者是我们聘请了一位对流程有深刻理解的AI高级副总裁，他会详细地映射出来。但他也对人工智能有深刻理解。这是我们最大的问题：我们缺乏既理解流程又理解AI并将两者结合起来的人。" — 保险公司高管

### 发现4：有效的支持者给予团队失败的许可

第一章报告了61%的成功项目包含先前的失败。但失败只有在特定条件下才能转化为学习。当我们审视支持者如何处理挫折时，三种策略将失败加速下一次尝试的组织与导致放弃的组织区分开来。

**失败期间支持者的连续性**。在我们能够识别同一高管是否赞助了失败和成功尝试的每个案例中，答案都是肯定的。在一家技术公司，构建然后废弃第一个平台的高管在六个月后亲自领导了重新设计。在一家半导体制造商，早期的AI计划停滞不前，因为工程部门在没有协调的情况下构建解决方案。监督这些失败的同一AI负责人向CEO升级并推动了第二波投产。当支持者在失败后更换时，机构记忆就走出去了：不要做什么，要让哪些利益相关者参与，真正的瓶颈在哪里。最重要的是，它向所有人发出了失败是职业风险的信号。

**作为失败策略的控制范围**。73%的实施故意从小开始，63%明确将试点框定为实验。这不是胆怯。这是政治计算。小试点失败成本低。低成本的失败不会终结职业生涯。一家专业服务公司在先前的技术实施中失败了两次。支持者接受了80%的准确性作为足够好继续前进，将不完美视为起点而非缺陷。从可实现的标准开始给了团队迭代的空间，而没有在第一次尝试就交付成品的压力。

**反馈循环而非发布日期**。对失败最有效的方法不是事后容忍它，而是事先设计好处理它。在一家半导体制造商，失败和成功尝试之间的转变是使持续用户反馈和迭代成为解决方案生命周期中的一等优先事项，而不是将每次部署视为成品。

共同点：在我们检查的任何案例中，没有人因失败的AI计划而受到惩罚。

### 案例研究：半导体公司的现场服务

**公司**：一家为企业客户生产固态硬盘的半导体制造商。公司有多个具有不同技术要求水平的部门：工程和IT在前面，运营和财务在中间，法律和人力资源在后面。

**问题**：当企业客户报告问题时，现场服务工程师需要在诊断前收集技术数据。产品规格、测试库、数据表、工程日志分布在五六个不同团队拥有的不同存储库中。仅数据收集的服务级别协议(SLA)就是40小时。

> "文档、不同的数据表、不同的测试库，都没有集中化。每一个都由不同的团队拥有。当你有一个发现时，所有这些都必须汇集在一起。" — 制造公司AI负责人

**第一次尝试失败了**。早期的AI计划构建了基于LLM的数据分析代理。它们在演示中有效但在生产中无效。问题不是技术性的。工程部门为自己的用例构建解决方案而没有协调。没有共享标准，没有采纳的责任制。

**支持者做了什么**：AI负责人认识到部门赞助不够。他通过三个具体行动向CEO升级：

1. **在每个部门建立AI冠军**。工程和IT采纳很快。但法律、人力资源和其他非技术部门落后了。支持者在每个部门创建冠军来推动点对点采纳。

> "我看到的是组织内有不同的成熟度水平……所以我们在每个部门获得了AI冠军。" — 制造公司AI负责人

2. **将AI采纳制定为企业OKR**。当同行压力不够时，支持者向CEO升级，将AI采纳纳入公司衡量成功的方式。

3. **通过AI演示日创造可见的领导承诺**。CEO出席演示日，给予推动采纳的团队认可。这表明AI是战略优先事项，而非IT实验。

> "我们有AI演示日，CEO颁发奖励。来自做工作的人的认可和自豪实际上在推动势头向前。" — 制造公司AI负责人

**解决方案**：在组织支持到位后，团队为现场服务瓶颈构建了多代理框架。当客户问题进来时，代理自动从所有存储库中提取数据。

> "代理框架所做的是进入五六个不同的区域，寻找与此客户、此问题、此工程领域相关的信息，然后将其拉入。" — 制造公司AI负责人

**结果**：
- 数据收集时间：40+小时 → < 1小时
- 完整数据的问题：0% → 95%+
- 产品测试周期：减少20%

**关键教训**：当需要跨职能采纳时，部门AI计划会遇到天花板。将AI采纳与企业OKR和奖金挂钩突破了标准沟通和培训无法克服的阻力。

> "AI是心态的改变，仅此而已。它实际上是完全由变革管理驱动的。" — 制造公司AI负责人

---

## 第五章：致命的阻力来自哪里？

*理解推力的来源及如何克服*

### 已发表的研究发现

**终端用户采纳是主要障碍。** 埃森哲将缺乏员工采纳列为主要挑战之一。[9]

**领导参与程度不同。** 麦肯锡指出，33%的高绩效者有高级领导者积极推动采纳，而总体池中显著更少。[11]

**劳动力构成很重要。** Anthropic发现，技术工人集中的美国州有更高的AI采纳率，表明非技术劳动力的阻力可能更高。[10]

上述研究没有将中层管理作为独特的阻力来源进行隔离，也没有解决阻力的性质：是害怕被取代、缺乏技能还是工具不好？

### 我们的发现

**职能部门（法律、人力资源、风险、合规）是最常见的阻力来源，占35%**，而非AI终端用户。每个来源因不同原因而抵抗：C级要求可衡量的ROI证明，职能部门担心流程风险和指责，终端用户不信任系统不一致性，一线工人害怕被取代。每个群体需要不同的解决方案。

### 发现1：职能部门，而非终端用户，是最常见的阻力来源

**项目阻力的主要来源**：
- 职能部门（法律、人力资源、风险、合规）：35%
- 终端用户：23%
- 高管/C级：18%
- IT部门：8%
- 中层管理：8%
- 无/最小：8%

传统智慧关注终端用户阻力，但职能部门是最常见的阻碍者。法律部门担心责任。人力资源担心变革管理。风险和合规团队担心监管暴露。这些职能拥有组织权力来减缓或停止项目，无论高管支持如何。

> "我看到的是组织内有不同的AI成熟度水平。工程和IT想推进。其他组织，也许是法律，正在退缩。" — 制造公司AI负责人

IT职能是一个显著的例外：它们不是阻碍，而更多地充当推动者，提供平台基础设施和数据管道，使业务部门能够更快地移动。

> "中层管理最具抵抗力，而高层管理和初级员工更容易接受。" — 零售公司高管

### 发现2：每个来源因不同原因抵抗，需要不同解决方案

**职能部门担心风险**。在一家大型银行，过去的监管问题使风险团队极其谨慎。解决方案是授权，而非说服。当AI采纳通过企业OKR影响薪酬且他们不需要为潜在失败承担责任时，法律和人力资源找到了启用而非阻碍的方法。当在治理中给予角色而非仅仅被告知批准时，职能部门经常从阻碍转向积极支持部署。

> "我几乎把所有时间都花在风险和控制上，那里每个人都很害怕做任何事。" — 大型银行高管

**C级要求ROI证明**。CFO在批准AI投资之前需要明确的财务依据。解决方案是在要求更广泛投资之前展示价值的衡量试点。

> "医院C级高管需要对资产负债表的直接逐行影响来证明软件购买的合理性。" — 医疗AI公司高管

**终端用户不信任不一致性**。习惯于确定性系统的用户难以适应AI的变异性。解决方案是设定期望：用户需要理解AI输出需要审查，以及常规任务的"足够好"表现为更高价值的工作腾出时间。

> "我们必须从设定现实的期望开始。其中一部分是改变思维过程并稍微转变范式。" — 咨询公司高管

**一线工人害怕被取代**。这是最受关注的担忧，但只在两个案例中出现。恐惧是真实的但可以解决。解决方案是展示具体的前进路径：什么工作消失，什么工作保留，以及角色如何演变。

### 案例研究：技术服务公司的安全运营

**公司**：一家拥有六人安全运营中心(SOC)的技术服务公司，每月处理约1,500个安全警报。大多数是需要手动分类的误报。

**问题**：团队被警报淹没。在有限的能力下，分析师只能彻底调查高优先级警报。低优先级警报获得最少的覆盖。工作是机械性的：分类、升级或关闭。分析师将大部分时间花在重复性任务上，而不是需要他们专业知识的判断密集型调查上。

**解决方案**：团队部署了一个自动化警报分类的AI系统。AI处理初始分类和误报过滤，以秒为单位而非小时处理警报。它只将需要人类判断的警报升级给分析师。

**阻力**：当领导层提出AI解决方案时，预期的担忧是工作保障。一个六人团队和AI能够替代大部分工作量，阻力的风险是真实的。

**支持者如何克服阻力**：技术负责人拥有完全授权且不依赖其他团队。他认可了该解决方案并将实施作为专门项目运行。

首先，背景做了大部分工作。团队已经不堪重负，无法覆盖低优先级警报。这不是一个表现良好会被AI打乱的团队。这是一个跟不上的团队。AI被定位为缓解，而非替代。

其次，工作分工是直观的。AI承担了消耗他们大部分时间的机械性分类：分类、误报过滤、常规升级。分析师保留了需要专业知识的判断密集型工作。

第三，支持者将释放的能力框定为向上的路径，而非出局。额外的带宽将用于团队从未有时间追求的更高价值活动。信息是具体的：AI替代的是公司本来需要雇用的人，而非已有的人。

> "你必须为人们制定路线图。对个人有什么好处？他们应该看到他们的生活变得更容易。因为它变得更容易，那个额外的带宽现在被用于其他活动，提升他们的技能。" — 技术服务公司高管

重新框定是具体的：AI替代的是你不需要雇用的人。你已有的人现在可以做两三个或四个人的工作。

> "AI不是替代你已有的人。AI是替代你不需要雇用的人。你已有的人现在可以做两三个人的工作。" — 技术服务公司高管

**结果**：
- 处理的警报：1,500 → 40,000/月
- 高优先级覆盖：→ 100%
- 所需团队能力：6 → 1.5 FTE
- 释放的能力重新部署：4.5 FTE

没有人被解雇。释放的4.5 FTE能力被重新部署到威胁猎取、安全架构和能力建设。

**关键教训**：当前进的路径具体时，对替代的恐惧就会消散。支持者准确地展示了什么工作会消失（机械性分类），什么工作会保留（专家调查），以及什么新工作会出现（能力建设）。一旦团队看到AI是从苦差事中的解放而非对就业的威胁，他们就从阻力转向了倡导。

---

## 第六章：当生产率提升很高时，人员编制会发生什么？

*裁员、重新分配还是冻结招聘？*

### 已发表的研究发现

**减少的预期。** 麦肯锡发现，32%的受访者预计其组织的员工将在明年因AI减少，而43%预计变化不大，13%预计增加。[11]

**服务运营受影响最大。** 在过去一年中，服务运营领域39%的受访者和制造业30%的受访者报告因AI导致员工减少。

**技能退化与技能提升。** Anthropic的分析表明，AI覆盖了高等教育任务，可能导致某些角色的技能退化和其他角色的技能提升。[10]

Anthropic最近的一篇论文调查了理论上的AI工作暴露与实际观察到的AI覆盖之间的关系，表明虽然在某些领域暴露率可达90%，但实际当前采纳率显著更低。[23] 这将有助于解释为什么目前对失业的影响可能还没有许多人担心的那么高。但随着采纳扩大，前景可能会变得更加黯淡。

上述研究捕捉了预期和汇总趋势，但没有将特定的高生产率项目与实际的人员编制决策联系起来。

### 我们的发现

**削减是最常见的结果，占45%，但不是多数。** 替代方案（避免招聘、无削减、重新部署）合计占55%。三种不同的策略出现：加速而非削减、重新部署到更高价值的工作，或直接减少人员编制。技术并不决定结果。创收应用更常导致重新部署或加速，而成本削减应用更常导致直接削减。

### 发现1：削减是最常见的结果，但不是多数

**AI部署后的人员编制结果**：
- 削减：45%
- 避免招聘：19%
- 无削减：19%
- 重新部署：17%

削减是最大的单一类别，但代表了不到一半的结果。今天，公司仍在寻找方法在不消除职位的情况下获取AI生产率。随着生产率提升增长和社会规范演变，这可能会随时间改变。

### 发现2：三种不同的策略出现

**策略1：加速而非削减。** 一些公司明确选择将生产率收益再投资于增长而非成本削减。

> "关于AI是否应该减少人员编制有争论。CEO和COO倾向于削减成本；我推动使用收益来加速路线图，因为有大量积压。" — 教育技术公司CTO

生产率收益用于更快地发布更多功能，而非减少工程人员编制。

**策略2：重新部署到更高价值的工作。** 其他公司将人员从自动化任务转移到需要人类判断的工作。在一家技术咨询公司，AI自动化了80%的发票处理。他们没有削减团队，而是将人员转移到下一个瓶颈。

**策略3：直接减少人员编制。** 一些公司裁员。在一家私募股权(PE)拥有的公司，编码领域88%的生产率提升导致开发团队从七人减少到三人。

选择取决于战略背景。成长阶段的公司倾向于加速。注重成本的所有者（私募、扭亏）倾向于削减。技术并不决定结果。

### 案例研究：教育技术公司的工程团队

**公司**：一家拥有数千名员工的教育技术公司，包括200多名技术人员和100多名工程师。公司在受监管行业提供继续教育和专业认证课程。

**AI实施**：CTO实施了三支柱AI战略：工程生产力工具、客户体验改进和AI差异化产品。工程团队进行了六个月的GitHub Copilot和Cursor试点。

> "结果：工程师早期节省了20-30%的时间和精力，随着提示和信心的提高预期会有上升。" — 教育技术公司CTO

在内容方面，公司重新架构了生产，使主题专家成为人在环审查者而非起草者。AI起草内容；SME精炼它。这产生了数百万的成本节省。

**人员编制辩论**：有了记录的生产率提升和成本节省，领导团队面临一个决定：使用收益减少人员编制还是再投资。CEO和COO在PE压力下倾向于削减成本。CFO最初不相信AI会产生净节省。CTO主张加速。

**决定**：对于工程，公司选择了加速而非削减。理由是战略性的：公司有大量产品待办列表。更快地发布功能比削减发布功能的团队会产生更多收入。

> "节省用于加速路线图，而非减少人员。" — 教育技术公司CTO

对于内容生产，节省被捕获并再投资：

> "我们在2025年预算中通过减少某些部门预算并再投资于AI捕获了真正的节省。最大的节省驱动因素：SME内容生产再工程。" — 教育技术公司CTO

**结果**：
- 工程生产率：节省20-30%时间
- 工程人员编制：无削减
- 节省再投资于AI开发

**关键教训**：生产率提升创造的是战略选择，而非自动结果。同样的收益既可以证明人员编制削减的合理性，也可以证明加速路线图的合理性。决定取决于公司是优先考虑近期成本削减还是长期增长。

### 前瞻性警示

以上发现来自回顾性数据：组织在2025年初之前如何处理AI驱动的生产率收益。主导我们样本的重新部署和加速模式可能不会持续，因为AI能力在提高，经济压力在加剧。

斯坦福数字经济实验室和Anthropic的研究提供了更广泛的劳动力市场转变已在进行中的早期证据。Brynjolfsson、Chandar和Chen（2025）分析了ADP覆盖数百万美国工人的高频工资单数据，发现AI暴露职业中的早期职业工人（22-25岁）自2022年底以来就业相对下降了16%。[5] Anthropic的一项补充研究发现迄今为止失业没有系统性增加，但识别出年轻工人在AI暴露领域的招聘已经放缓，实际AI部署仍远低于理论能力，表明劳动力市场影响仍处于早期阶段。[23]

这很重要，因为我们样本中记录的重新部署和避免招聘策略是早期采纳阶段的特征，当时组织仍在学习AI能做什么。随着实施成熟、模型改进和成本压力增加，结果的分布可能会转变。我们观察到的45%削减率可能代表的是底线，而非天花板。今天选择加速而非削减的公司，当下一代模型到来时可能面临不同的计算。金丝雀正在歌唱。

---

## 第七章：AI正在打开哪些以前关闭的大门？

*企业如何从效率走向新收入、新能力和战略优势*

### 已发表的研究发现

**收入增长是愿望，而非现实。** 德勤2026年对3,235名领导者的调查发现，74%的组织希望通过AI增长收入，但今天只有20%在这样做。只有34%正在使用AI通过新产品、服务或重新发明的商业模式深度转型其业务。[21]

**高绩效者追求增长，而非仅仅是效率。** 麦肯锡2025年AI状况调查发现，虽然80%的组织将效率设为AI目标，但看到最大价值的公司也将增长或创新设为目标[11]。然而，只有6%的组织报告AI对EBIT的影响超过5%，且大多数收入增长仍集中在营销和销售、战略和产品开发领域。[11]

已发表的研究表明，通过AI增长被广泛追求但很少实现。

### 我们的发现

大多实施以成本节约衡量。但最高回报来自将AI指向收入的公司：为每个客户而非细分群体个性化优惠、在数小时而非数周内达成交易，以及将内部工具打包为出售给客户的产品。其他人更进一步，使用AI做以前没有人尝试过的工作，如迁移遗留代码库或在没有结构化数据的市场中构建销售智能。

随着代理系统改变了工程师和产品经理的工作流，他们将越来越多地从手动编码和开发任务的苦差事中解放出来。这将给他们更多时间专注于更高价值的工作、实验和协作创新。随着时间的推移，这种工作模式变化中出现的新应用和想法可能会产生显著的回报。

### 发现1：来自AI的新收入是真实的，但罕见，遵循三种模式

我们样本中的大多实施以生产力或成本削减衡量。但一个子集显示了直接、量化的收入影响。区分这些案例的不是技术，而是有人衡量了收入方面，而不仅仅是成本方面。收入机制落入了可识别的模式。

**转化的个性化**。一家零售公司大规模部署AI个性化营销邮件，结合机器学习推荐引擎和生成式AI内容。第一个月，他们衡量了购买意向增加40%和实际购买增加20%。AI没有改变产品，它改变了每个客户看到的产品。

> "这做的唯一一件事就是给了他们更好的邮件来发送。" — 零售公司高管

> "60%打开了邮件，40%去了网站，可能20%购买了东西。" — 零售公司高管

一家每月服务数百万订单的食品配送公司从基于群体的细分（每细分500个客户）转向个人个性化。以前的方法不是慢，而是在结构上无法在这个粒度上运作。

> "现在你可以为每个人创建一个活动，而不是花三周创建50个活动。" — 食品配送公司高管

一家企业内容平台衡量了AI生成活动的点击率增加200%。上市时间从七周降到六小时。表面上两者都是效率指标，但它们解锁的量和精度直接转化为收入。

**赢得交易的速度**。一家保险服务公司发现AI驱动的合同起草将速度变成了竞争武器。以前需要数周的合同在四小时内交付。结果不仅仅是效率，他们赢得了本来会失去的交易。

> "他们在四小时内起草了一份非常完美的合同，由律师监督。在过去，这需要数周，他们可能会失去合同。" — 私募股权公司价值创造合伙人（运营公司所有者）

在响应速度决定谁能获得交易的市场中，四小时对比四周不是效率提升。这是中小企业不同的竞争定位。

> "中小企业可以更好地响应这种杠杆，他们实际上可以成为这场革命的赢家。" — 私募股权公司价值创造合伙人（运营公司所有者）

在半导体制造中，相同模式在不同规模出现。将测试周期减少20%并将客户问题解决从40小时缩短到不到一小时，改变了公司争夺企业客户的方式。

> "当产品上市时间缩短时，这不是500万、1000万的节省。这是数亿美元的节省。" — 半导体制造商高管

**从洞察到产品**。一些公司发现他们的内部AI能力可以成为收入来源。一家为营销归因构建了分析平台的咨询公司意识到AI层可以生成预测性推荐并模拟活动结果。该公司现在正在将此作为产品推出，预计从平台"翻倍"收入。

> "随着我们走向模拟器的产品化，是的，可能收入翻倍是我们的预期。" — 咨询公司高管

一家技术服务公司更进一步。在为内部使用构建AI发票处理解决方案后，他们将其打包并开始对外销售。一家专业服务公司的内部AI平台现在服务于新客户，成为服务线的基础。

> "我们实际上将其打包并带给了一些客户。地球上前三名的咨询公司之一正在使用它。" — 技术服务公司高管

这些案例共享的不是共同的技术栈或行业。而是有人问了一个超越"我们如何降低成本？"的问题并衡量了答案。

> "ROI是王道。如果你能在销售周期中展示这一点，它会立即将你带到你需要去的地方。我整个职业生涯都在尝试用其他东西销售效率，这真的很难。" — 医疗AI公司创始人

### 发现2：AI正在使从未在路线图上的工作成为可能

除了收入，另一组案例显示AI使全新的工作变得可行。不是现有流程的更快版本。没有人计划或预算的工作，因为它被认为是不可能的。

**重写被认为技术上不可能的事**。一家拥有超过1亿客户的金融科技公司需要将数百万行遗留ETL代码迁移到现代架构。传统估计需要18个月和1,000多名工程师。使用AI编码代理，业务部门开始在数周内完成迁移。

> "工程师不再需要跨多个文件并100%完成整个迁移任务，他们只需审查更改，做小幅调整，然后合并他们的PR。" — 金融科技公司高管

一家保险公司发现AI可以从头开始重写遗留系统比重构它们更快。一个最初报价5,000小时、七人团队、计划2027年完成的项目，用三人团队在600小时内完成。这开启了一个公司从未考虑过的战略问题：

> "你是购买一个客户群然后尝试改造它吗？你能从头开始并颠覆一家公司，通过构建他们的技术吗？" — 保险公司高管

**在不可能存在的情况下构建市场智能**。在有保险的医疗保健市场，销售团队购买理赔数据来确切知道哪些提供者开什么处方、什么数量。那是标准策略。但医疗美容完全是现金支付。没有理赔、没有集中注册、没有结构化数据集。这个市场的区域情报不是昂贵或缓慢的，它是不可能的。一家医疗AI公司通过构建一个系统改变了这一点：抓取公开来源、组装提供者档案、按估计的手术量和增长潜力对潜在客户评分。销售代表第一次在一个从未有过合格管道的市场中有了合格管道。该公司现在正在扩展平台以服务其他制造商。

**将运营转化为数据资产**。一家机器人检测公司正在从一致的AI驱动检测中生成历史数据集，实现预测分析和事件取证。竞争对手无法在没有多年类似部署的情况下复制这些数据。检测开始时是一个效率策略。它们产生的数据正在成为一个全新的资产。

这些案例有一个共同特征：在AI使它们成为可能之前，它们不在路线图上。没有人要求团队更快地完成这项工作。AI不仅用于提高效率，涌现的解决方案使自己可见。工作本身是新的，解决了一个他们没有意识到存在的问题。

### 案例研究：呼叫中心的客户关系

**公司**：一家呼叫中心即服务(CCaaS)公司，为企业客户提供传统呼叫中心服务：接听电话、路由查询和管理工单队列。在一个越来越由AI原生竞争对手定义的市场中，公司的价值主张面临压力。

**问题**：CCaaS市场正在转变。企业客户开始期望AI驱动的能力作为标准，而非高级附加服务。AI原生初创公司从第一天就可以提供智能路由、自动解决和实时分析。公司的传统模式基于席位定价和人类代理，同时面临两个威胁：竞争对手可以在每次交互中提供更多价值，以及底层定价模式随着AI减少客户需要的席位数量而被侵蚀。

> "其中一个问题是它对SaaS模式有影响，因为它减少了席位数量。所以你需要找到一种新的定价方式。" — 私募股权公司价值创造合伙人

挑战不是运营效率，而是战略相关性。

**解决方案**：管理团队将代理式AI直接嵌入公司的产品。他们没有使用AI使人类代理更快，而是重新设计了服务，使AI可以端到端地解决工单——不仅仅是接听电话或回答问题，而是实际关闭问题。

技术方法使用了代理式AI框架，可以编排完整的解决过程。这超越了副驾驶式协助，进入了自主任务完成。

**结果**：
- 新项目赢得：20+归因于AI
- 市场定位：AI客户体验领域前4名
- 客户获取：赢得新客户
- 竞争重新定位：传统CCaaS → 与AI原生公司对标

**AI解锁了什么超越成本削减**：本可以用来减少人员编制或降低每张工单成本的技术栈反而重新定位了公司在市场中的位置。三件与效率无关的事情改变了。

首先，公司开始赢得以前无法竞争的交易。产品中的AI能力成为差异化因素。30个新项目被赢得，不是因为公司更便宜，而是因为它比仍以传统模式运营的竞争对手更有能力。

其次，公司的竞争集改变了。一项独立技术评估将公司列为AI客户关系能力的前四名。另外三家是AI原生公司。一家传统呼叫中心现在与初创公司对标，而非其他现有公司。

第三，定价模式开始转变。公司可以销售结果而非席位。AI能力成为产品，而非应用于旧产品的成本削减工具。

> "基本上，我们看到的是这种[AI]是一种帮助我们赢得新交易的方法。" — 呼叫服务公司高管

**关键教训**：为效率部署的AI节省资金。部署到产品中的AI改变了竞争地位。差异不在于技术。问题不是"我们如何降低成本？"而是"我们如何赢得以前无法赢得的交易？"这家公司问了第二个问题，30个新项目后，答案很清楚。

> "我坚信，如果你为中型公司和小型公司提供正确的能力，他们就处于非常有利的位置来赢得AI革命。决策制定快得多。他们没有那么多遗留系统。他们不知道如何处理非结构化数据，现在他们可以使用它。他们缺乏资源，资源可以通过AI增强。" — 私募股权公司价值创造合伙人（运营公司所有者）

---

## 第八章：代理式AI是否产生了真正的价值？

*自主AI在哪里有效，简单方法在哪里胜出*

### 已发表的研究发现

**高炒作，低规模。** 麦肯锡报告称，62%的组织在试验AI代理，但只有23%在扩展它们。扩展仅限于一两个职能，最常见的是IT和知识管理。[11]

**细分领域出现价值。** OpenAI报告称，企业AI采纳正在不同行业不均衡地加速，技术(11倍)、医疗保健(8倍)和制造业(7倍)显示出最快的同比增长，而金融和专业服务在最大绝对规模上运行。[12]

**可靠性限制。** Anthropic警告说，成功率随着任务复杂度增加而下降。他们的数据表明，对于需要人类约3.5小时工作的任务，API成功率降至50%以下。[10]

**代理能力正在指数级增长。** METR，一个独立的AI评估组织，衡量前沿模型可以可靠地自主完成的软件任务长度。他们的研究显示，这一指标自2019年以来大约每七个月翻倍，但最近几个月有所加速。截至2026年初，最有能力的模型现在可以可靠地完成不需要人类干预的任务，这些任务需要人类专家约15小时。[22] 这一轨迹表明，适合代理式AI的企业任务集将在短期内大规模扩展。这些是基准能力；实际部署仍取决于集成、权限和异常处理。

### 我们的发现

代理式实施目前是少数，仅占案例的20%。很可能因为企业AI代理框架直到2025年才进入大众意识。但即使在如此不成熟的脚手架下，代理式AI在高容量、明确成功标准和可恢复错误的职能中实现了更高的中位生产率提升（**71%对比高自动化的40%**）。随着这些系统成熟和用例扩大，我们预期代理式AI的优势会加速。值得注意的是，代理式AI不仅仅是访问AI的新方式，它是工作流中人与机器角色的重新定义。公司开始将AI视为团队的延伸，而不仅仅是工具，由人类指导和监督，但越来越能够代表他们行动，并将人类能力放大到超出仅看团队人数时的预期。

### 发现1：代理式AI已在生产中，但大多实施使用更简单的方法

| 级别 | 定义 | 占比 |
|---|---|---|
| 代理式 | AI采取自主行动，端到端完成多步骤任务而无需人类干预 | 20% |
| 高自动化 | AI自主处理>80%的工作，人类仅审查例外或最终输出 | 34% |
| 人在环 | AI和人类一起工作，人类在行动前审查或批准每个输出 | 46% |

代理式实施是少数。大多成功的企业AI使用更简单的方法：带异常处理的高自动化或人在环协作。这不意味着代理式AI失败了。它表明许多用例尚不需要完全自主来交付价值，更大的阻碍可能是技术成熟度不足和劳动力的部署经验有限。

### 发现2：代理式AI实现了更高的生产率但方差更大

代理式实施显示了最高的中位生产率提升71%。最高收益来自现场服务，多代理框架自动跨存储库收集数据。人在环显示22%中位数，适合人类判断必不可少的文档审查和临床文档。

随着时间推移，随着代理框架成熟，我们预期越来越多的用例将落入完全自主类别。在编码领域，这一趋势已经越来越明显。编码代理（Claude Code、OpenAI Codex等）自主运行数天交付数万或数十万行工作代码的例子在近几个月并不罕见。

这种自主能力水平不仅会提高生产率，还会重新定义组织中的角色。技术经验有限或没有的团队成员很快将能够仅通过与工具集的自然语言对话来构建和部署复杂项目，就像他们过去与开发团队负责人做的那样。这种能力水平不会局限于软件开发领域。可以预见，此类工作流将迅速扩展到金融、会计、咨询服务和其他数据密集型行业。当普及时，这对更广泛经济的宏观劳动力影响可能是巨大的。

### 发现3：成功的代理式实施具有共同特征

十个代理式案例聚集在特定职能（采购、现场服务、安全运营、编码和客户支持分类），但比职能更重要的是这些实施的共同点：

**高容量、重复性任务**。安全运营处理数千个警报。采购处理数百个决策。客户支持分类工单。容量证明了构建自主系统的投资合理性。

**明确的成功标准**。警报有效或无效。采购决策正确或不正确。工单已解决或未解决。AI可以根据客观标准评估自己的输出。

**可恢复的错误**。错过的警报可以稍后捕获。错误的采购建议可以被覆盖。失败的工单解决升级到人类。错误代价高昂但不是灾难性的。

**跨系统的数据访问**。代理式AI需要查询多个系统、收集信息和采取行动的能力。成功的实施在数据基础设施和API访问方面进行了投资。

> "不要只是将AI应用于你现有的流程。那是错误的。我们正在重新设计我们的工作流，这就是我们成功的原因。" — 技术公司运营负责人

### 案例研究：连锁超市的采购

**公司**：一家拥有大约二十多家门店的区域连锁超市。与拥有大量利润率和巨大采购能力的市场领导者不同，这家公司的运营利润率大约是行业基准的一半，对供应商的谈判杠杆最小。

**问题**：超市经济是无情的。利润率微薄，浪费持续存在，缺货会永久失去客户。公司面临三个相互关联的挑战：

第一，浪费。易腐商品在货架上过期，季节性产品订购数量错误，促销商品卖不出去。

第二，缺货。空货架不仅失去一笔销售，它失去了开车去竞争对手那里可能不会回来的客户。

第三，采购时机。人类买家基于直觉、供应商关系和他们能手动汇编的任何数据做出决策。他们不可能跨25家门店优化数千个SKU。

**解决方案**：公司部署了一个完全替代人类采购功能的AI系统。系统不协助人类或生成供审查的推荐，它自主做出采购决策。

架构有三个组件：从多个系统拉取库存、销售和供应商数据的数据平台；在门店和SKU层面预测销售的需求预测模型；以及决定买什么、何时买以及从哪个供应商购买的自主采购代理。

> "他们用一个正在购买的AI工具替代了人类采购人员。告诉他们买什么。所以再次，超市里装满了东西，库存得到了优化。" — 零售公司项目负责人

**使它成为代理式的三个方面**：

首先，它替代了人类职能，而不仅仅是任务。AI完全接管了采购角色，同时决定买什么、何时买以及买多少。做出相同决策的人类买家无法在这个规模上优化。

其次，它连接了以前由直觉处理的多个决策步骤。一个采购决策需要预测需求、检查当前库存、考虑供应商提前期以及平衡浪费与缺货。系统跨每家门店的每个产品持续处理这个链条。

第三，它跨多个系统运行而无需人类编排。AI从不同来源拉取库存数据、供应商目录和销售历史，将它们一起处理并输出采购决策。以前，人类买家是集成层。

**结果**：
- 浪费减少：40%
- 缺货减少：80%
- EBITDA利润率：翻倍

> "市场领导者有更高的利润率。这些家伙非常小。但他们做得几乎一样好，与大玩家相比他们的采购能力为零。但他们有的是——他们没有浪费。" — 零售公司项目负责人

**关键教训**：这个案例说明，即使对于更传统的行业，当代理式AI被正确应用时，它创造了真实价值：对规则来说太复杂但对人类来说太重复的任务，具有明确的成功标准和可恢复的错误。跨数十家门店的数千个SKU需要持续优化，没有任何人类可以执行。AI可以评估自己的表现，因为结果是可衡量的：产品是卖掉了、过期了还是缺货了？对于一个与巨头竞争的小零售商来说，代理式AI将智能变成了规模的替代品。

### 样本局限性和未来展望

我们关于代理式AI的发现应附带一个重要警示：在我们的数据收集期间（2024年8月至2025年1月），代理技术仍在涌现。我们样本中只有20%的实施涉及代理工作流，大多数组织在试验而非扩展。代理案例的有限样本反映了当时的技术状态，而非其长期轨迹。

这一轨迹很可能是变革性的。基础模型和代理框架在推理、规划多步骤工作流和从错误中恢复的能力方面正在快速改进。这些正是定义代理式AI的能力。随着这些模型的进步，适合代理方法的企业用例份额将大幅增长。今天需要结构化自动化和人类监督的任务可能越来越多地由能够驾驭模糊性并做出上下文依赖决策的自主代理处理。

我们在代理式实施中观察到的71%中位生产率提升（对比高自动化的40%）表明，当代理式AI应用于正确的用例时，影响显著更大。随着技术成熟和成功部署的条件被更好地理解，我们预期代理式实施将代表企业AI价值创造中日益主导的份额。本章中记录的模式捕捉了一个可能重塑组织如何思考人与机器工作边界的趋势的早期阶段。

---

## 第九章：企业数据到底需要多干净？

*为什么真正的数据挑战是访问和存储，而非清洁度*

### 已发表的研究发现

**清洁数据是扩展者的优势。** 在战略扩展者中，61%拥有大型准确数据集，而困在概念验证阶段的公司只有38%。战略扩展者擅长"调出数据噪音"以专注于金融、营销和客户数据等优先领域。[9]

**数据产品是关键。** 麦肯锡指出，高绩效者更有可能创建了"可复用的、业务特定的数据产品"。[11]

**非结构化数据容忍度。** OpenAI报告称，结构化工作流（自定义GPT和项目）的企业使用同比增长了19倍，现在处理约20%的所有企业消息。这表明组织通过构建对现有数据的访问层而非要求在部署AI之前拥有完美的数据结构而取得成功。[12]

上述研究建立了清洁数据与AI成功的相关性。它没有量化数据在仍能产生结果的情况下可以有多混乱。

### 我们的发现

只有**6%**的实施拥有完全准备好用于AI的数据。但在大多数存在数据挑战的案例中，LLM是解决方案的一部分，而非只是清洁数据的消费者——它们是使混乱数据可用的工具。模型在88%的案例中解锁了以前无法访问的数据，处理了语音转录、扫描文档、遗留代码和分散的知识库，这些是以前任何技术都无法处理的。一个警示：因为此样本关注成功的实施，它可能低估了数据质量被证明不可克服的案例。该发现反映了通过有意设计可能实现的结果，而非普遍保证。

### 发现1：LLM不仅仅在消费数据——它们在修复数据！

传统叙事假设AI需要清洁数据才能工作。我们的数据讲述了一个不同的故事。只有6%的实施拥有完全准备好用于AI部署的数据。绝大多数面临从中度到严重的数据挑战。然而在大多数这些案例中，LLM是解决它们本应难以处理的数据问题的方案的一部分。

**LLM如何解决跨实施的数据挑战**：
- 多种解决方案：53%
- 提取、清洗、结构化和多源匹配：31%
- 语音处理、结构化：6%
- 转换遗留格式（如Java到自然语言菜单）：3%
- 分类、区分信号与噪音：3%
- 翻译：3%
- 其他：1%

这是一个根本性转变。以前，非结构化数据需要人类分析师在任何分析发生之前施加结构。现在，91%的实施成功处理了两年前无法使用的非结构化数据，包括语音转录、扫描文档、图像、聊天日志和遗留代码。在88%的案例中，LLM解锁了以前无法访问的数据——不是因为它不存在，而是因为以前的方法（OCR、规则引擎、手动标记）无法以所需的准确性和规模处理它。

> "合作伙伴告诉我们，清理这些数据需要两个月，而你们在一天内就标记了所有数据问题。" — 专业服务公司AI副总裁

新近可访问的数据类型跨越了企业信息的全范围：

**语音和对话数据**。医疗保健中的环境转录使医生-患者对话首次对编码团队可访问。呼叫中心转录成为实时指导和质量评估的来源。以前，编码团队没有窗口了解临床决策。现在他们拥有了完整的对话。

> "有了环境转录技术，那个人现在可以访问作为该人医疗护理一部分讨论的所有内容。医疗护理的可审计性和可追溯性现在通过这项技术变得更加可能。" — 医疗保健公司高管

**分散的文档和知识库**。一家半导体制造商通过部署多代理框架将数据收集减少了10倍以上，该框架自动从五六个不同的存储库中拉取信息。数据在技术上是可用的，但由于组织孤岛和手动汇编所需的时间，实际上无法访问。

> "文档、不同的数据表、不同的测试库——都没有集中化。每一个都由不同的团队拥有。" — 半导体制造商工程副总裁

**视觉和多模态数据**。现场技术人员现在可以拍摄设备照片并接收即时的AI生成维修说明。零售采购系统处理扫描的纸质表格、电子邮件和Excel电子表格，这些以前需要大量手动数据输入人员。

> "你可以拍一张照片，AI会立即给他一个该设备的详细描述以及如何修复它。" — 电信公司AI副总裁

### 发现2：流程文档和访问比数据完美更重要

在我们能够评估数据架构的实施中，59%的数据分散在由不同团队拥有的多个系统中。只有16%拥有完全集中的数据。然而成功不需要集中化，需要的是访问。

构建集成层——无论是API、RAG架构还是多代理框架——来连接分散数据的组织，与拥有集中数据存储的组织表现一样好。在LLM之前的世界中，企业必须在提取价值之前结构化和集中数据。今天，如果检索层设计良好，RAG架构和知识库连接器可以处理混乱数据。

> "所有艰苦的工作都在流程文档和数据架构中。如果你能做好这两件事，其他一切都相当简单。" — 专业服务公司AI副总裁

一家电信公司为不同设备类型构建了不同的知识库，为它们建立索引，并通过模型上下文协议(MCP)给予AI代理访问权限，而从未集中底层数据。

> "我们基本上为不同对象构建了不同的知识库。MCP可以访问我们为不同情况构建的各种工具。" — 电信公司AI副总裁

### 发现3：专有数据是持久的竞争优势

每个前沿实验室都在训练它能访问的每一条公共数据。组织无法在那个轴上竞争。但每家公司都有前沿实验室从未见过或被允许看到的专有数据。那些数据就是他们的优势。

在我们的样本中，75%的实施提到专有数据是其AI战略的关键因素，47%明确将其积累的数据描述为竞争护城河。跨行业的模式一致：从AI中产生最多价值的组织是那些在知道如何使用之前很久就一直在存储数据的组织——即使是不完美的数据。

> "我们的差异化，人们购买我们的原因，是因为在过去13年的业务中，我们创建了这个知识图谱。我们有超过200亿个数据点。" — HR技术公司高管

> "力量来自于利用独特资产：数据、SME、客户群、关系。差异化需要别人无法快速复制的东西。" — 教育技术公司CTO

启示很直接。保存一切。存储数据的成本与没有数据时的成本相比微不足道。保存数据的组织——无论多么不完美——正在建立随时间复合的竞争优势。随着开源模型与专有模型之间的性能差距缩小，差异化因素从你使用什么模型转变为你喂给它什么数据。

### 案例研究：建筑服务公司的采购

**公司**：一家拥有需要将零件送到工地的现场技术人员的大型建筑服务公司。

**问题**：技术人员通过纸质表格、电子邮件和Excel电子表格提交请求。团队手动将这些输入采购系统并将物品与零件目录匹配。缓慢、容易出错、昂贵。

**解决方案**：AI从非结构化来源提取请求，匹配到目录，并自动创建请购单。还识别不在目录中的物品并建议替代品。

**数据挑战**：双方都有数据质量问题：

> "从非结构化来源提取的质量不好——OCR没有给我们好的结果。我们匹配到的结构化数据质量也不一致。核心数据本身不是最好的质量。" — 专业服务公司AI实践负责人

**如何克服**：一个逐步改进数据的四阶段管道：

1. OCR失败时用Python提取
2. 使用向量化和嵌入的生成式AI清洗
3. 尽管参考数据不完美仍进行模糊匹配
4. 例外情况的人在环

> "我们从'这是你的要求；这是它将做的'转变为'好到什么程度就够了？'如果你监控它并随时间给它更好的数据，AI会改进。" — 专业服务公司AI实践负责人

**结果**：
- 投资：50万-100万美元
- 生产率提升（3-5年预测）：30%
- 预期ROI：3年内10倍

**关键教训**：为"足够好"而非完美设计。每个管道阶段即使前一阶段的输入不完美也增加了价值。

---

## 第十章：严格的安全是保护项目还是扼杀项目？

*安全要求如何影响AI项目结果*

### 已发表的研究发现

**安全是首要任务。** 麦肯锡报告称，51%的组织正在努力缓解网络安全风险，这是仅次于不准确性的第二大常见缓解措施。[11]

**受监管行业并未被阻止。** OpenAI报告称，医疗保健作为最受监管的行业之一，是企业AI采纳增长最快的三个行业之一，同比增长8倍，而金融服务在最大绝对规模上运行。[12]

### 我们的发现

在我们的样本中，安全不是纯粹的项目杀手。在每个安全造成障碍的案例中，这些相同的要求最终使项目能够处理原本无法接触的敏感数据。当正式渠道跟不上步伐时，影子AI就会出现。安全税是真实的但是前置的。

### 发现1：最初阻碍的安全要求最终会启用

在有完整数据的12个案例中，我们发现安全从来不是纯粹的项目杀手。在每个安全造成障碍的案例中，这些相同的要求最终使项目能够处理原本无法接触的敏感数据。

模式一致：被迫构建强大数据保护基础设施的团队解锁了没有此类基础设施的竞争对手无法触及的用例。

> "在大多银行的心态是必须完全在内部。我们不使用防火墙外的任何软件或硬件。现在当你引入AI时，一切都是基于云的，所以我们必须更新那种政策。" — 大型金融机构高管

同一家机构，经过多年安全工作，现在运行处理敏感金融数据的面向客户的AI，在发送到外部模型之前清洗个人身份信息(PII)，并在返回时重新组装。安全投资成为竞争对手无法快速复制的能力的基础。

### 发现2：当正式渠道跟不上步伐时，影子AI出现

影子AI指的是员工在没有IT或安全团队正式授权的情况下使用AI工具和平台。它是AI时代的影子IT等价物，但带有放大的风险：员工常规性地将专有数据、客户记录和内部文档上传到缺乏企业安全控制的消费级AI平台。[13]

问题很普遍。行业调查发现，70%到80%在工作中使用AI的员工依赖未经雇主批准的工具。[14] 一项IBM研究发现，虽然80%的工人使用AI，但只有22%使用完全由公司提供的工具。[15] 在使用未授权平台的人中，57%承认输入了敏感公司信息。[16] 财务后果是真实的：AI相关的数据泄露平均每次事件给组织造成超过400万美元的损失。[13]

我们的案例研究证实了这些发现，并揭示了数字背后的组织动态。

影子AI在15%的案例中被明确提到。出现了两种不同的模式：

**模式A：热情超过治理**。一家半导体制造商发现了公司内使用的大量不同AI工具集合。员工并非恶意。领导层在任何平台存在之前就发出了"使用AI"的信号。

> "当我做安全分析时，我们发现公司员工在使用1,500或1,600种不同的AI工具。所以我们的目标是在我们说不能使用未批准工具之前构建可用的内部平台。" — 半导体制造商高管

**模式B：绝望击败官僚主义**。在医疗保健领域，医生在没有正式批准的情况下采纳了环境转录工具，因为医院系统评估和采购它们太慢了。医生疲惫不堪，技术存在，正式流程耗时太长。

> "很多医生一直在没有批准或正式供应商选择流程的情况下采纳这些技术。" — 医疗AI公司高管

洞察不在于影子AI是好是坏。而在于影子AI是政策比技术慢的症状，需要被预期但在一定程度上考虑。当正式安全流程跟不上需求时，用户会找到变通方法。在医疗、金融和政府等行业，法律和监管责任可能是巨大的。

### 发现3：安全税是真实的，但投资会持续回报

量化安全延迟很困难，但来自受监管行业的定性证据表明税是巨大的。

> "我来自科技创业公司，在那里如果你不尝试就会消亡。去一个金融服务领域内的大型受监管机构……完全是天壤之别。" — 大型金融机构高管

在此环境中的项目需要多年才能建立。那是安全税最极端的形式。

但税是前置的。一旦基础设施存在，后续项目就可以利用它。公司构建了数据清洗管道、与云提供商建立了合同并创建了合规的归档系统。每个新的AI用例现在都建立在该基础之上，而非从头开始。

**何时税是合理的**：当安全投资启用原本不可能的用例时是合理的。处理客户财务数据、处理医疗记录、管理机密并购文档：没有强大的安全，这些都不可能。

**何时税是浪费的**：当安全在不启用解决方案的情况下阻止解决员工/客户问题的工作时是浪费的。当正式流程太慢时，影子AI填补了空白，加剧了流程旨在预防的许多安全风险。

### 案例研究：大型零售银行的客户面向

**公司**：一家通过移动应用、分行和呼叫中心服务数百万客户的美国大型零售银行。该银行在联邦银行法规下运营，由于过去的合规问题，面临创造了深度风险厌恶文化的同意令。

**问题**：银行希望在其移动应用中部署AI驱动的虚拟助手。但其技术政策禁止在企业防火墙外使用任何软件或硬件。现代AI是基于云的。该政策使基于云的AI变得不可能。

**解决方案**：团队开发了具有四个组件的数据保护架构：

**出口时PII清洗**。客户话语在离开防火墙之前被剥离姓名、账号和金额。

**合成数据替代**。在外部处理期间，假值替代真实值。

**外部意图处理**。云模型确定客户意图并选择适当的工作流。

**返回时重新组装**。在呈现响应之前，真实值在内部重新插入。

> "我们发送到Google Cloud平台的是所需的最小清洗数据集。我们交换假名字、假金额。它仍然可以辨别意图是什么。然后在返回时，我们将所有这些重新合并到响应中。" — 大型金融机构高管

**结果**：
- 渠道成本：最低服务成本
- 通话遏制：减少48-72小时
- 下一阶段：用于调度的代理式AI

**关键教训**：安全是基础设施，而非开销。花在安全上的年份构建了大规模处理敏感财务数据的基础。没有那个投资，银行无法提供触及客户账户的AI服务。税是前置的。大部分安全成本在第一次部署之前。后续用例利用相同的管道、合同和归档系统。警示：由于现在有许多高能力的开源解决方案可用，可能有可行的选项在内部部署AI功能，可以在不改变现有政策的情况下交付类似结果。风险厌恶文化是最难的障碍。技术解决方案不完全简单，但启用文化灵活性确实给了它比竞争对手更快的上市时间优势。改变由过去同意令塑造的文化是真正的挑战。

---

## 第十一章：什么时候基础模型选择不是商品？

*模型选择何时重要、何时不重要，以及什么驱动开源与闭源决策*

### 已发表的研究发现

**随着复杂度增加，模型质量更重要。** Anthropic显示，随着任务时间范围增长，成功率急剧下降，这意味着对于复杂的、长时间范围的或代理式工作流，模型能力成为约束条件。[10]

**推理工作负载在增长。** OpenAI报告推理token消耗同比增长320倍，表明企业正在将模型推向更复杂的领域，性能差异可能很重要。[12]

**开源模型达到闭源模型性能的90%。** MIT研究分析了五个月的OpenRouter推理数据，发现开源模型在发布时常规性地达到专有模型质量的90%或更多，并快速收敛。但闭源模型仍占约80%的token使用。[17]

**超过一半的企业已经在使用开源AI。** 麦肯锡、Mozilla和McGovern基金会对700名技术领导者的调查发现，超过50%的组织在其堆栈中的某处使用开源AI，在技术公司中上升到72%。[18]

**成本差距比性能差距关闭得更快。** 开源模型达到大约90%的专有模型性能，同时根据Artificial Analysis基准和定价数据，平均每个token的成本低六倍。[19][20]

已发表的研究捕捉了商品问题以及开源和闭源模型之间的成本和性能权衡。它没有解决的是生产中的企业实际上如何做出这些决策，在基准之外的因素塑造结果的地方。

### 我们的发现

**42%的实施中，模型选择完全是商品。** 商品边界存在于任务复杂度：常规任务是高级任务4倍可能成为商品。多模型策略是新兴常态，抽象层将领导者与落后者区分开来。尽管开源可用性不断增长，企业压倒性地默认使用专有模型，决策由能力和速度而非成本驱动。警示：随着开源和闭源模型之间的能力差距继续缩小（正在快速发生），商品类别中的任务百分比可能会大幅增长。

### 发现1：对于大多企业用例，模型选择是商品

| 判定 | 百分比 |
|---|---|
| 商品（可互换） | 42% |
| 中等重要性 | 39% |
| 关键差异化因素 | 19% |

模式一致：成功来自模型周围的一切——数据质量、流程文档、集成架构、变革管理——而非模型本身。

> "我们做过的最重要的事情是花大量时间在我们的RAG上，真正确定我们的分块策略。" — 专业服务公司总监

### 发现2：商品边界由任务复杂度定义

我们根据认知需求将实施分为两类：

**常规任务**：重复性、基于规则的工作，具有明确的成功标准。客户支持分类、文档搜索、营销内容、招聘筛选。

**高级任务**：需要多步推理、领域专业知识或重要决策的工作。复杂编码、合规分析、临床文档、代理式工作流。

**按任务复杂度的模型重要性**：
- 常规任务：商品71%，中等重要性29%，关键差异化因素0%
- 高级任务：商品18%，中等重要性47%，关键差异化因素35%

在常规任务中，71%将模型视为完全可互换，没有一个认为它是关键差异化因素。在高级任务中，只有18%将其视为商品，而35%视为关键。

> "这里的进入壁垒比传统上低得多，因为LLM变得更加商品化。" — 医疗AI公司高管

### 发现3：多模型策略是新兴常态

大多实施使用多个模型而非承诺单一提供商。多模型方法采取了几种形式：

**任务特定路由**。不同任务使用不同模型：使用快速、便宜的模型进行分类，使用更有能力的模型进行生成或推理。成本差异可达10倍或更多。通常小模型可以本地运行，意味着基本上只是电力成本而非使用昂贵的模型API，这可以带来巨大的节省，更不用说隐私好处了。

**通过冗余进行验证**。通过两个不同的模型运行相同的查询，只接受匹配的答案。

> "我认为我们用两个不同的RAG模型运行它。如果我们得到相同的答案，那就是好答案。如果两个RAG模型不匹配，那就是坏答案。" — 专业服务公司项目负责人

**基于查询的优化**。通过为每个模型添加智能评估和路由层，查询系统可以根据用例需求获得显著收益。

> "我们构建了多LLM网关。真正解决基于查询的成本、准确性、相关性、延迟的能力。在每个查询中，目标是说好吧，这个结果需要深度搜索吗？还是小模型就够了？" — 技术公司运营负责人

### 发现4：模型抽象层正在成为竞争优势

最复杂的实施包含抽象层，允许在不重新架构系统的情况下切换模型。这些组织将模型视为更大平台内的可互换组件。

> "我的重点不在于工具。我的重点是构建平台，一旦平台在那里，他们就会使用平台。你有灵活性在模型之间切换，如果一个变得比另一个更好或更便宜。" — 技术公司运营负责人

一家食品配送公司在多个基础模型之上构建了自己的AI聊天机器人：OpenAI、Gemini和Claude。这个抽象层使他们能够在客户服务中实现90-95%的自动化，而不依赖任何单一提供商。

拥有抽象层的组织共享一个共同理念：模型正在快速且不可预测地改进。他们没有押注单一提供商，而是构建了允许他们从任何来源采纳改进的基础设施。随着所有前沿和开源实验室的快速发布，系统为工作选择正确模型的能力本身正在成为竞争优势。

**最高绩效的实施将模型视为其控制的平台内的可互换组件。持久的优势在编排层，而不在基础模型。**

### 发现5：开源模型正在进入生产，但在专业角色中

开源并非缺席企业部署。它出现在定制和控制超过前沿能力需求的特定职能中：命名实体识别等专业任务、需要完全模型可视性的安全功能，以及领域数据微调驱动初始架构的初创产品。

一家主要金融服务机构说明了新兴模式。其核心面向客户的能力运行在专有模型上，但其信息安全功能使用开源模型，团队需要定制和控制模型的确切行为方式。

> "我们用于信息安全的一些模型，我会说支持或辅助类型的模型……我们可能对一些使用开源模型，比如特别是NER，命名实体识别。那些是开源的。" — 主要金融服务机构高级高管

一家网络安全供应商走了不同的路径，将其整个产品建立在Llama作为基础模型之上并进行了大量微调。选择不是关于性能领导力，而是关于以可管理的成本将模型适应狭窄领域的能力。

> "我们只是拿Llama作为基础模型然后修改了它。" — 技术服务公司高管

在另一端，一家云原生软件公司完全拒绝了开源模型，优先考虑专有企业级许可带来的安全和隐私保证。

> "我们避免了大多数开放或免费或未经批准的工具，因为隐私和安全条款和条件。我们是云原生的；没有本地自托管。" — 软件公司工程领导者

**企业AI中的开源采纳正在通过专业、低风险的职能进入。问题不是企业是否会使用开源模型，而是支持基础设施将多快赶上以使其对核心生产工作负载可行。随着闭源和开源产品之间的差距缩小，鉴于可观的成本和技术主权优势，开源将日益获得心智份额。**

2026年初有能力的中国开源模型（Qwen、Kimi、Minimax、GLM等）的兴起缩小了与专有模型的能力差距，同时保持了显著的成本优势。在OpenRouter上，一个为超过400万用户跨400多个模型路由API请求的平台，按token量排名前5的模型中有4个现在是中国开源的，主要由消耗比传统聊天机器人使用多指数级token的代理工作负载驱动。话虽如此，大多美国企业部署仍严重依赖美国提供商，如OpenAI、Anthropic、Meta的Llama和Google的Gemini，合规、支持和供应商资格认证仍然是关键因素。随着代理驱动架构的扩展，管理模型选择和推理成本（有时称为token经济学）与实时模型选择将成为技术团队日益重要的能力。

### 发现6：当前焦点是能力和速度，而非成本

超过三分之二讨论模型选择标准的企业将能力作为选择的首要原因，而非成本。企业选择能最快交付结果的模型，而非成本最低的。

当通过总拥有成本而非单独推理价格来看时，这种模式是有道理的。一家零售公司最初在专业供应商之上构建了自定义解决方案，然后发现它可以使用通用专有模型以更少的总体工作量复制相同功能。

> "我们最终用Claude重新开发了相同的代码。我们取消了合同，拥有了我们自己的专有解决方案。" — 零售公司高管

几家组织围绕多年积累的专有数据而非模型选择构建了他们的竞争护城河，正如第九章所讨论的。

数据主权——通常被引用为推动开源和自托管的因素——得到了与预期不同的解决。企业不是部署本地模型，而是与云提供商谈判合同保护。主权通过合同和数据最小化而非模型架构来解决。

**开源在推理层面的成本优势是真实的，但我们交谈的企业今天还没有优化推理成本。他们正在优化价值实现时间、运营简单性和风险降低。对于初创公司来说，模式可能看起来不同，推理成本从一开始就是更紧的约束，开源采纳往往更高。随着饥饿的token代理实施的兴起，推理成本很可能成为模型选择的主要因素。随着小型和开源模型的能力与前沿模型的差距缩小，成本和技术独立性因素将在模型选择过程中看到它们日益主导的角色。**

### 案例研究：技术公司的客户支持

**挑战**：客户支持量的增长速度超过了他们雇用代理的能力。技术挑战不是构建聊天bot，而是构建可以将查询路由到最优模型、优化成本/准确性/延迟、避免供应商依赖并随着新模型可用而改进的基础设施。

**解决方案**：公司没有选择单一模型提供商，而是构建了一个将模型选择从应用层抽象出来的多LLM网关。网关基于四个优化维度路由每个查询：成本、延迟、相关性和准确性。

> "我们不只用一个。我们用Claude，我们用OpenAI，我们也用一些Llama。所以我们用不同的模型。我们有时也用Bedrock。" — 技术公司运营负责人

**结果**：
- 工单转移：82%
- 解决率：71%
- 代理生产率：提升40%+
- 支持人员：减少32%

**关键教训**：这个案例说明了为什么模型抽象比模型选择更重要。上述业务成果是由大规模自动化客户支持驱动的。多LLM网关主要在该系统内优化成本和延迟，并帮助公司避免了三个架构陷阱：

**供应商依赖**。他们可以在不重新架构的情况下从任何提供商采纳改进。

**成本优化**。他们按查询优化，而非做出单一的全局模型选择。

**面向未来**。随着模型改进，基础设施可以自动吸收那些技术和成本改进。

对于常规客户支持查询，任何前沿模型都适用。对于需要深度搜索或高准确性的复杂查询，更有能力的模型被路由进来。系统持续优化，无需任何人做出战略性的"模型选择"决策。

---

## 结论

本研究始于一个看似简单的问题：当企业在生产中部署AI时，实际会发生什么？在研究了41个组织、9个行业、7个国家的51个成功实施后，答案比主流叙事所暗示的更加细致和可操作。**技术是有效的。挑战在于其他一切。**

也许最违反直觉的发现是这项工作实际关于什么。AI是新奇的，许多高管进入AI项目时预期技术是最难的部分。实际上，大多数最困难的挑战与技术无关。它们关乎理解机会、重新设计流程、赢得持怀疑态度的团队的信任，以及构建允许模型在真实业务环境中运行的数据基础设施。42%的案例中，模型本身完全可以互换。成功的组织不一定有更好的AI，而是有更好的流程和执行。

这种执行遵循了一个可识别的模式。高管支持者在失败中坚持——不仅在成功中——在我们能够追踪的每个案例中，监督失败尝试的同一高管领导了成功的那个。迭代开发在数周内交付了工作软件。以及管理阻力的有意策略——不仅来自害怕被替代的一线工人，还来自法律、人力资源、风险和合规部门，它们占了项目阻力的最大部分。克服这些职能需要与企业OKR挂钩的授权，而非说服。

人类监督问题产生了研究中最实际相关的洞察之一。升级模式——AI自主处理80%或更多工作，人类仅审查例外——与71%的中位生产率提升相关，对比更传统运营模式（需要人类批准每个输出）的30%。这不意味着更少的监督普遍更好。受监管行业和高风险决策需要设计上的人类审查。但对于高容量、可恢复的任务，给予AI更多自主权的组织实现了显著更好的结果。

就业图景比乐观者或悲观者暗示的更加复杂。削减是最常见的人员编制结果，占45%，但不是多数。替代方案——包括避免招聘、重新部署和明确维持人员编制的决定——都发挥了突出作用。在许多情况下，新型价值创造——而不仅仅是成本规避——是可持续商业价值的关键。然而，这些模式反映了早期采纳阶段的回应。随着模型能力和代理框架成熟，经济力量可能会推动市场走向日益增加的劳动力替代，但它也必然会产生一些新的增强机会。

### 从数据中浮现的行动手册

**从看不见的无形工作开始。** 流程文档、数据访问层和变革管理不是附加在真正工作上的开销。它们通常就是真正的工作。将这些视为前提条件而非事后考虑的组织更快地达到生产并实现了更高的回报。

**投资于衡量。** 部署前应确定明确的KPI。拥有强大指标的组织更有可能展示价值并扩展其项目。关键指标包括质量、客户价值和收入增长的指标，超越人员编制削减或成本节约。

**保存一切。** 即使是混乱的、不完整的或看似无用的数据，现在也有价值，因为LLM可以从非结构化来源中清洁、结构化和提取含义。囤积数据的组织——即使是不完美的数据——一旦模型赶上，就拥有了复合优势。存储数据的成本通常与没有数据时的成本相比微不足道。

**从第一天起构建多模型架构。** 最成功的实施将模型视为其控制的编排层内的可互换组件。将每个任务路由到基于成本、准确性、隐私和延迟的最优模型。使用小模型进行分类，大模型进行推理和规划，开源用于专业功能或受监管行业，专有用于行业特定能力。早期构建这种灵活性的组织避免了供应商锁定并自动捕获了提供商的快速改进。

**为代理式AI做规划。** 代理式和非代理式实施之间的生产率差距——71%对比40%的中位收益——只会随着模型改进而扩大。现在为自主工作流构建基础设施的组织——包括明确的决策边界、结构化升级和多系统数据访问——将被定位来捕获下一波价值。开源模型将在代理式实施中变得更加重要，因为控制推理成本显著更容易且更可预测。

### 更广阔的图景

我们正处于一个**"生产率分岔口"**，宏观经济结果取决于组织是使用AI来创造新任务和增强工人，还是主要用于削减成本和减少人员编制。[2] 我们的数据显示两条路径同时被追求并取得成功，随着技术成熟，尚不清楚平衡正在向哪个方向转变。组织和政府在未来几年如何驾驭这个分岔口，将决定这项变革性技术是带来广泛共享的繁荣，还是集中收益和社会不稳定。

鉴于发达国家中暴露工作的比例，政府计划和政策来再培训或支持被替代的工人可能将日益必要。即使我们对AI在经济中创造巨大价值的潜力高度乐观，过渡也不会像以前的通用技术那样平稳。

**实验窗口正在关闭。** 问题不再是AI是否会交付价值。而是组织能否足够快地进化来捕捉它，以及组织在效率实现时帮助工人和社区平稳过渡的社会责任。经济和社会结构的稳定可能取决于今天的领导者如何回答这个问题。

---

## 附录

### 按职能划分的关键绩效指标

在部署前定义明确KPI的组织更有可能展示价值并确保持续投资。然而许多团队默认使用一套狭窄的效率指标——通常以人员编制削减衡量——而忽略了质量、客户价值和收入增长的指标，这些指标通常被证明更可持续和更有影响力。我们都知道这句话：你得到你所衡量的，在AI赋能的项目中，尤其如此。我们希望这些KPI衡量选项可以帮助您的组织找到超越原始生产效率的新价值实现方式。

#### 客户支持
- **工单/来电转移率**：AI无需人工代理介入即可解决的查询份额
- **平均处理时间(AHT)**：解决客户交互的总时间，包括通话时间和通话后工作
- **自助解决率**：AI转移的交互中实际解决（而非仅转移）的份额
- **客户满意度(CSAT)**：客户报告的对支持交互的满意度
- **支持人员减少**：AI自动化带来的支持人员减少

#### 销售
- **销售代表节省的时间**：为销售代表腾出的用于高价值销售活动的每日时间
- **潜在客户发现速度**：与手动流程相比识别和研究潜在潜在客户的时间
- **转化率**：将潜在客户转化为付费客户的比率
- **工具采纳率**：定期积极使用AI工具的销售团队份额

#### 工程
- **开发时间减少**：完成开发任务的工程时间减少
- **任务完成速度**：完成单个编码或迁移子任务的时间
- **团队规模与产出**：工程团队规模相对于交付产出的变化
- **代码质量评分**：AI生成代码输出的成功率和准确性
- **新产品**：从AI实施中出现的新或未计划的产品

#### 营销
- **活动上市时间**：从简报到活动启动的时间
- **内容生产成本**：创建营销内容和活动材料的成本
- **点击/转化率**：由AI生成内容驱动的客户参与和购买行为
- **个性化规模**：创建个性化活动与批量细分的能力

#### 法律与合规
- **文档审查/起草时间**：审查、起草或处理法律文档的时间
- **文档处理量**：在给定时间内处理和搜索的文档数量
- **信息检索准确性**：从法律文档中提取信息的准确性（带来源验证）

#### 采购
- **浪费/缺货减少**：通过需求优化减少库存浪费和缺货事件
- **商品成本降低**：通过更好的谈判、供应商匹配和时机实现的节省
- **处理时间减少**：从接收到采购订单处理采购请求的时间

#### 财务运营
- **处理准确性**：AI系统正确处理的发票或交易百分比
- **人员减少/成本节约**：自动化财务处理带来的人力和成本节约
- **积压消除速度**：处理交易和消除处理积压的时间

#### 人力资源与招聘
- **每个职位的筛选时间**：筛选给定职位全部候选人库的时间
- **端到端招聘效率**：整个招聘管道的整体生产力改进
- **候选人转化率**：筛选候选人转化为成功招聘的比率

#### IT运维
- **运营成本降低**：自动化IT支持和内部运营带来的成本节约
- **人员与系统比率**：管理AI自动化系统或机器人所需的人数
- **技术人员自给自足能力**：现场人员无需升级到支持即可解决问题的能力

#### 现场服务
- **数据收集时间**：收集客户问题分类所需的所有技术数据的时间
- **SLA达成率**：在约定SLA时间内解决的客户问题百分比

#### 医疗保健
- **临床文档时间**：临床医生花在文档与患者护理上的时间
- **收入周期时间**：从服务交付到收到付款的时间
- **编码准确率**：AI建议的计费代码与医生批准代码之间的一致性

#### 保险运营
- **理赔处理效率**：理赔处理员重复任务时间的减少

### 常见失败模式及如何克服

在我们的访谈中，61%的AI实施在达到生产价值之前经历了至少一次重大失败。像"项目困在试点"或"无法证明ROI"这样的常见症状频繁出现，但这些是后果而非原因。下表将失败合并为六个根本原因，显示它们如何表现，并记录了公司如何克服它们。

| 根本原因 | 占比 | 表现形式 | 如何克服 |
|---|---|---|---|
| 组织未准备好采纳 | 35% | 试点停滞从不扩展；尽管部署但使用率低；没有内部冠军 | 获得与OKR挂钩的可见CEO授权；将AI定位为消除重复任务而非替代人员；赋能初级大使绕过抵触的中层管理；提供针对特定用例的结构化培训——不仅仅是工具访问 |
| 关键知识从未被捕获或存储 | 27% | 模型给出通用或错误的答案；输出质量低于有经验员工的交付；用户失去信任并停止使用 | 在任何AI项目开始前构建可访问的数据架构；将知识文档作为前提条件而非事后考虑；使用AI本身从员工中提取和结构化隐性知识 |
| 法律或合规团队阻止项目 | 18% | 项目延迟数月等待批准；用例限于低价值安全区 | 将法律作为合作伙伴尽早参与，而非最后一刻的守门人；从第一天起实施PII清洗、编辑和审计跟踪；在被要求之前构建风险和控制流程 |
| 技术不成熟或出故障 | 16% | 系统在生产规模下失败；昂贵的返工周期；用户看到错误后失去信任 | 构建吸收快速技术进化的模块化框架；使用混合方法：80%技术，20%人工精炼；从双重模型验证开始再信任单一输出 |
| 选择了错误的问题或设定了不切实际的期望 | 14% | 寻找问题的解决方案；领导层过早终止项目 | 端到端映射流程并首先找到真正的瓶颈；与终端用户（而非仅仅是高管支持者）验证用例；设定大多AI项目在第一次尝试时失败的期望；将成功框定为迭代改进而非第一天完美 |
| 人才或赞助缺口 | 12% | 缓慢的迭代、供应商依赖；冠军离开时项目失去优先级 | 创建专用数据科学角色——不要只是再培训现有人员；确保跨多个领导层级的赞助；构建内部能力使进展不依赖于一个人；持续记录胜利以保持组织承诺 |

### 研究样本概况

我们的51个案例研究来自跨多个地区的41个组织。下表以匿名形式呈现每个组织。

**41个组织 · 7个国家 · 5个地区 · 100万+合并员工**

| 组织 | 行业 | 职能 | 地区 |
|---|---|---|---|
| 制造公司 | 制造业 | 招聘、薪酬与福利 | 亚洲 |
| 消费品公司 | 其他 | HR共享服务 | 亚洲 |
| 物流公司 | 其他 | 培训 | 亚洲 |
| 技术公司 | 软件与技术 | HR支持 | 亚洲 |
| IT安全服务公司 | 软件与技术 | IT运维 | 亚洲 |
| 保险公司 | 金融服务 | 理赔处理、文档审查 | 欧洲 |
| ERP咨询公司 | 金融服务 | 财务运营 | 欧洲 |
| 制造公司 | 制造业 | 供应链与运营 | 欧洲 |
| 呼叫中心 | 其他 | 客户支持 | 欧洲 |
| IT服务公司 | 其他 | 财务运营 | 欧洲 |
| 连锁超市 | 零售 | 采购 | 欧洲 |
| 人才管理平台 | 软件与技术 | 招聘 | 欧洲 |
| 半导体公司 | 制造业 | 销售 | 全球 |
| 全球咨询公司 | 其他 | 建筑采购 | 全球 |
| 数字银行 | 金融服务 | 软件开发 | 拉丁美洲 |
| 证券交易所 | 金融服务 | 软件开发、合规、客户支持 | 拉丁美洲 |
| 能源交易公司 | 其他 | 客户支持、营销 | 拉丁美洲 |
| 食品配送与零售平台 | 零售 | 客户支持、营销 | 拉丁美洲 |
| 保险软件公司 | 金融服务 | 软件开发 | 北美 |
| 零售银行 | 金融服务 | 客户支持 | 北美 |
| 医疗设备制造商 | 医疗保健 | 销售 | 北美 |
| 老年护理提供商 | 医疗保健 | 患者监测 | 北美 |
| 医院 | 医疗保健 | 临床文档、收入周期 | 北美 |
| 律师事务所 | 法律服务 | 文档审查 | 北美 |
| 全球汽车制造商 | 制造业 | 客户支持、IT运维 | 北美 |
| 工业机器人公司 | 制造业 | IT运维 | 北美 |
| 半导体存储制造商 | 制造业 | 现场服务、产品开发 | 北美 |
| 工业制造商 | 制造业 | 质量保证 | 北美 |
| 能源公用事业公司 | 其他 | 营销内容生成 | 北美 |
| 包装物流公司 | 其他 | 冷链监测 | 北美 |
| 在线学习平台 | 其他 | 软件开发、内容起草 | 北美 |
| 专业服务公司 | 专业服务 | 尽职调查、招聘 | 北美 |
| 咨询公司 | 专业服务 | 文档审查 | 北美 |
| 零售公司 | 零售 | 营销内容生成 | 北美 |
| AI驱动的BPO | 零售 | 销售自动化 | 北美 |
| 零售公司 | 零售 | 采购 | 北美 |
| 联络中心 | 软件与技术 | 客户支持 | 北美 |
| 移动广告归因公司 | 软件与技术 | 营销 | 北美 |
| 技术公司 | 软件与技术 | 客户支持、销售 | 北美 |
| 电信公司 | 电信 | IT运维 | 北美 |
| 电信运营商 | 电信 | 营销内容生成 | 北美 |

---

## 尾注

[1] Erik Brynjolfsson, Daniel Rock, and Chad Syverson, "The Productivity J-Curve," American Economic Journal: Macroeconomics 13, no. 1 (2021): 333–372.

[2] Erik Brynjolfsson and Gabriel Unger, "The Macroeconomics of Artificial Intelligence," IMF Finance & Development, December 2023.

[3] Daron Acemoglu and Pascual Restrepo, "Automation and New Tasks," Journal of Economic Perspectives 33, no. 2 (2019): 3–30.

[4] Daron Acemoglu, "The Simple Macroeconomics of AI," NBER Working Paper 32487, April 2024.

[5] Erik Brynjolfsson, Bharat Chandar, and Ruyu Chen, "Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of AI," Stanford Digital Economy Lab Working Paper, 2025.

[6] Erik Brynjolfsson et al., "GDP-B: Accounting for the Value of New and Free Goods," American Economic Journal: Macroeconomics 17, no. 4 (2025): 312–344.

[7] MIT NANDA Initiative, "The GenAI Divide: State of AI in Business 2025," July 2025.

[8] McKinsey & Company, "The State of AI in Early 2024," McKinsey Global Survey, May 2024.

[9] Accenture, "AI: Built to Scale," Accenture Applied Intelligence, 2019.

[10] Anthropic, "The Anthropic Economic Index," 2025–2026.

[11] McKinsey & Company, "The State of AI in 2025: Agents, Innovation, and Transformation," McKinsey Global Survey, November 2025.

[12] OpenAI, "The State of Enterprise AI," December 2025.

[13] ISACA, "The Rise of Shadow AI," September 2025. IBM, "2025 Cost of Data Breach Report."

[14] WalkMe / SAP, "AI in the Workplace Survey," August 2025.

[15] IBM / Censuswide, "Is Rising AI Adoption Creating Shadow AI Risks?," November 2025.

[16] TELUS Digital / Fuel iX, "Shadow AI in the Enterprise," February 2025.

[17] Frank Nagle and Daniel Yue, "The Latent Role of Open Models in the AI Economy," MIT / Georgia Tech, November 2025.

[18] McKinsey, Mozilla Foundation, and McGovern Foundation, "Open-source in the Age of AI," February 2025.

[19] OpenRouter and Andreessen Horowitz, "State of AI: An Empirical 100 Trillion Token Study," December 2025.

[20] Artificial Analysis, "Intelligence Index v4.0," January 2026.

[21] Deloitte AI Institute, "The State of AI in the Enterprise: The Untapped Edge," January 2026.

[22] METR, "Measuring AI Ability to Complete Long Tasks," February 2026.

[23] Anthropic, "Labor Market Impacts of AI: A New Measure and Early Evidence," March 2026.

---

*斯坦福数字经济实验室 · 2026年4月*
