企业第一次做 AI,很容易把题目出得太大。
有人想做一个公司级知识平台,有人想让 Agent 自动跑完整流程,还有人一开始就在比较模型参数和私有化集群。
方案越聊越完整,真正要从哪件工作开始,反而没人说得清楚。
我现在更倾向于先做一个不那么“像战略”的动作:把各部门觉得麻烦的工作列出来,挑一件试两周。
第一条流程选对了,公司会得到真实经验。选错了,几个月后通常只剩一套没人愿意维护的演示系统。
先找工作,不要先找模型
让每个部门提交五到十项重复工作,不用写AI方案,只回答这些问题:
- 一个月发生多少次;
- 一次需要多少时间;
- 哪几个人参与;
- 输入资料在哪里;
- 最终结果是什么;
- 结果由谁检查;
- 出错以后能不能撤回;
- 涉及什么敏感数据。
这一步会筛掉不少“看起来很适合AI”的场景。
比如战略判断很重要,但发生频率低,结果也很难在短期验证,不适合成为第一个试点。付款审批很重复,却涉及高风险权限,同样不适合让AI先自动执行。
第一次试点更适合从会议整理、工单分类、资料检索、测试用例、周报汇总这类工作开始。
它们不一定最有想象力,但更容易看见结果。
用一张表把感觉变成比较
每个候选场景按八个维度打1到5分:
| 维度 | 1分 | 5分 |
|---|---|---|
| 发生频率 | 偶尔发生 | 每天重复 |
| 人工耗时 | 几乎不耗时 | 占用多人较长时间 |
| 输入数字化 | 主要靠口头和纸张 | 文档、表格、接口已经在线 |
| 输出可验证 | 很难判断对错 | 有规则或人员可以快速检查 |
| 流程可撤回 | 错了难以恢复 | 可以退回草稿重新处理 |
| 系统可集成 | 完全封闭 | 有API、Webhook或导入导出 |
| 数据可使用 | 权限和质量都不清楚 | 来源、权限、责任人明确 |
| 业务负责人支持 | 没人负责 | 有使用者愿意持续反馈 |
再单独记录风险:客户隐私、财务影响、生产影响、错误是否容易发现、是否能够人工复核。
不要把风险简单从总分里减掉。
有些场景收益高,风险也高。它们不是没有价值,只是不适合第一批自动执行。可以先改成“AI生成草稿,人确认后继续”。
一个可以直接照着算的例子
下面是一个假设的中小企业评分,不代表真实项目结果:
| 场景 | 收益评分 | 风险 | 第一阶段做法 |
|---|---|---|---|
| 客户会议转跟进任务 | 35 | 中 | AI整理,销售确认后写入CRM |
| 售后工单自动分类 | 37 | 中 | AI给分类和建议,客服确认 |
| 项目周报自动汇总 | 33 | 低 | 从任务系统生成草稿,负责人修改 |
| 付款审批自动通过 | 31 | 高 | 暂不自动审批,只做异常提示 |
如果只能选一个,我会优先考虑售后工单分类或会议转任务。
原因不是它们分数最高,而是输入、输出和人工确认都比较清楚。两周以后,能直接计算节省了多少整理时间,分类错了多少次,员工是否愿意继续使用。
两周试点只做一条细流程
试点不要写成“提升客服效率”。
把范围缩到:
客户消息进入工单
→ AI建议一个问题分类
→ AI提取设备、版本和故障现象
→ 客服确认或修改
→ 保存到工单系统第一周只旁路运行。AI给结果,但不自动写入正式字段。负责人每天抽查,记录错误类型。
第二周再允许确认后的结果写回系统。仍然不让AI直接退款、承诺交付时间或关闭投诉。
试点至少留四份记录:
- 改造前单次耗时;
- AI结果被直接采用的比例;
- 人工修改最多的地方;
- 出错后怎样恢复。
什么情况下应该停止
AI试点不是只能成功,及时停止也是结果。
出现这些情况,可以先停下来:
- 为了让AI工作,员工需要额外整理大量资料;
- 结果无法快速验证,人工检查比原工作更累;
- 数据权限说不清楚;
- API、账号或网络稳定性无法支撑日常使用;
- 业务负责人不使用,只剩技术人员在维护演示;
- 错误造成的业务代价超过节省的时间。
停掉不代表AI没用。
它可能说明场景选早了、流程没理顺,或者公司应该先整理数据,而不是先接模型。
第一个场景真正要验证什么
两周结束后,不要只汇报“调用了多少次”。
应该回答:
- 每次工作节省了多少人工时间;
- AI结果有多少可以直接采用;
- 错误集中在哪几类;
- 人工确认有没有成为新瓶颈;
- 谁愿意继续使用;
- 每月账号、API和维护成本是多少;
- 这条做法能不能复制到第二个人。
第一条AI流程的价值,不只是省下几十个小时。
更重要的是,公司第一次知道了:自己的数据够不够用,员工愿不愿意改,人工边界应该放在哪里,效果应该怎么量。
先把这几个问题回答出来,再谈全公司铺开,会稳很多。
暂无评论