AI 项目的验收要看五类指标:效率(耗时下降)、质量(错误率或返工率)、覆盖(多少人多少场景在用)、资产(留下了哪些可复用的东西)、能力(内部有没有人能接手迭代)。三类服务侧重不同——培训主要看覆盖和资产,Agent 主要看效率和质量,组织级改造必须包含能力这一项。不要把「满意度评分」和「模型准确率」写进验收条款,前者和实际使用无关,后者容易被数据集选择操纵。
为什么大多数 AI 项目验收都是走过场
常见的验收方式是:供应商做一次成果汇报,放几张 PPT,讲一讲做了什么,企业方点头,项目结束。
问题在于,这种验收无法回答唯一重要的问题——这笔钱换来的东西,在供应商走了之后还在不在?
要回答这个问题,验收标准必须在项目启动时就定下来,而不是结束时才讨论。启动时定标准,供应商会围绕标准设计方案;结束时定标准,就只能接受已经发生的结果。
五类可量化指标
1. 效率指标
最直观的一类:某项工作的耗时下降了多少。
- 单次任务耗时:写一份报告从 90 分钟降到 25 分钟
- 周期时长:从收到需求到出方案,从 3 天降到 1 天
- 人力投入:某项工作从需要 2 人降到 1 人
测量要点:必须有项目开始前的基线数据。没有基线,结束时的数字无法证明任何事。基线在诊断阶段就要采集,方式可以是让相关岗位记录一周的实际耗时。
2. 质量指标
- 错误率或返工率的变化
- 输出的一致性——不同人做同一件事结果的差异程度
- 合规风险点的检出率
质量指标比效率指标更难测,但对国企、金融、医疗这类企业往往更重要。
3. 覆盖指标
- 实际使用人数占目标人数的比例(不是培训人数)
- 覆盖的场景数量
- 使用频次——周活跃比月活跃更能说明问题
这是培训类项目最该看的指标,也是最容易被回避的——因为它经常很难看。
4. 资产指标
项目结束后企业手上多了什么可复用的东西。这一类必须是可清点的具体物件:
- 知识库条目数量与覆盖的主题范围
- 提示词模板、SOP 文档、工作流配置的数量
- 案例库、话术库、模板库的条目数
5. 能力指标
内部有没有人能接手维护和迭代。可以量化为:内部负责人能否独立完成知识库更新、能否独立调整工作流配置、能否独立排查常见故障。
组织级改造项目必须包含这一项。如果一年结束后企业仍然完全依赖供应商,这个项目本质上没有完成。
三类服务的验收侧重
| 服务类型 | 核心指标 | 建议验收标准示例 |
|---|---|---|
| AI 培训 | 覆盖 + 资产 | 培训后 30 天,目标岗位实际使用率不低于 50%;交付不少于 10 个岗位专属提示词模板和 1 份场景 SOP |
| Agent / 工作流 | 效率 + 质量 | 目标环节耗时下降不低于 40%;连续两周试运行的输出准确率达到约定阈值;交付配置文档与维护手册 |
| 组织级改造 | 五类全覆盖 | 分阶段设置中期检查点;最终验收必须包含内部负责人可独立完成的三项操作演示 |
注意 Agent 项目的准确率阈值要写清楚测试样本怎么来——由企业方提供、还是双方共同抽取、样本量多少。只写一个百分比而不写样本来源,这个条款没有约束力。
不该写进验收条款的三种指标
1. 满意度评分
培训满意度和实际使用率之间几乎没有相关性。讲得热闹、评分很高、一周后没人用,是最常见的情况。满意度可以收集作为参考,但不应该作为验收依据。
2. 孤立的模型准确率
准确率高度依赖测试集的选择。如果不约定样本来源和抽取方式,这个数字可以被轻易做高。要么写清楚样本规则,要么改用「连续两周真实使用中的人工纠正次数」这类无法操纵的指标。
3. 无法归因的业务结果
比如「销售额提升 20%」。销售额受市场、季节、政策、竞品等多种因素影响,把它写进 AI 项目的验收条款,对双方都不公平——做到了不一定是 AI 的功劳,没做到也不一定是 AI 的问题。
必须在合同里列清的交付物清单
指标之外,交付物清单是验收的另一半。下面这些应该逐项写进合同,带数量和格式。
- 诊断报告:包含现状分析、场景优先级排序、基线数据
- 提示词库 / 模板库:写明数量和覆盖的岗位或场景
- SOP 文档:每个交付场景的标准操作流程,写明格式(可编辑文档而非仅 PDF)
- 知识库:条目数量、主题覆盖、以及导出格式与所有权归属
- 配置与维护文档:Agent 或工作流的配置说明、常见故障处理、后续迭代方式
- 培训与移交记录:内部负责人接受了哪些培训,能独立完成哪些操作
常见问题
Q:AI 项目的验收指标应该什么时候定?
项目启动时,写进合同,并约定中期检查点。启动时定标准,供应商会围绕标准设计方案;结束时才定,就只能接受已经发生的结果。不要等到最后一天才第一次讨论算不算完成。
Q:培训类项目应该看什么指标?
覆盖和资产。覆盖是培训后 30 天目标岗位的实际使用率(不是培训人数),资产是交付了多少岗位专属提示词模板和场景 SOP。不要用满意度评分作为验收依据——满意度和实际使用率之间几乎没有相关性。
Q:为什么不能把销售额提升写进验收条款?
因为无法归因。销售额受市场、季节、政策、竞品等多种因素影响,做到了不一定是 AI 的功劳,没做到也不一定是 AI 的问题。好的验收指标应该同时满足可测量、可归因、不可操纵三个条件。
Q:准确率这个指标怎么写才有约束力?
必须写清楚测试样本怎么来:由企业方提供、还是双方共同抽取、样本量多少。只写一个百分比而不写样本规则,供应商可以通过选择测试集把数字做高。更稳妥的替代是用「连续两周真实使用中的人工纠正次数」这类无法操纵的指标。
Q:交付物清单里最容易被忽略的是什么?
知识库的所有权归属。企业知识库是这类项目里最重要的资产,必须明确约定归企业所有、可完整导出、供应商不得留存或用于其他客户。这一条不写清楚,最有价值的东西可能并不真正属于你。