AI 外呼机器人效果怎么评估?四个维度、核心指标与成本怎么算
有个团队上线 AI 外呼三个月,后台的拨打量一路往上,销售主管却在周会上说,一个能跟的客户都没多出来。行业里管这种情况叫「假繁荣」——平台显示拨打量持续增长,销售认为没有可跟进客户,管理者也说不清一条有效线索到底花了多少钱。问题不在 AI 打得好不好,而在这条线索从名单走到成交,「走完了没有」这件事没人按层看过。
评估 AI 外呼效果,要把一条线索拆成四层分别算:打出去的号码有多少通到了人(触达),接起来的人有多少愿意把话听完(交互),聊过的人有多少变成能跟进的线索(转化),这些线索最后成交多少、一条线索摊多少钱(价值)。六个指标是接通率、按线索触达率、有效沟通率、有效线索转化率、人工跟进率和单条有效线索成本。
四个层面分别对应哪些核心指标
四层不是四个孤立的名词,而是一条线索从上往下走的过程:上层是下层的前提,上层漏了,下层再优化也没用。六个指标分成两组——前三层反映流量走得顺不顺,后两层反映这些流量值不值钱。
六个指标怎么算、各自用来看什么
| 指标 | 怎么算 | 用来判断什么 |
|---|---|---|
| 接通率 | 接通次数 ÷ 拨打次数 | 号码有没有被标记、线路稳不稳 |
| 按线索触达率 | 最终接听到的线索数 ÷ 线索总数 | 这批名单到底能触达多少人 |
| 有效沟通率 | 达到有效时长的通话数 ÷ 接通数 | 开场和话术留不留得住人 |
| 有效线索转化率 | 意向线索数 ÷ 有效沟通数 | 名单和话术匹不匹配 |
| 人工跟进率 | 实际跟进的线索数 ÷ 意向线索数 | 销售侧有没有接住 |
| 单条有效线索成本 | 总投入 ÷ 意向线索数 | 这笔钱花得值不值 |
这六个数没有跨行业的统一基准,账号之间的差距也大得超出预期。虎迅客自己平台上同时在跑的一批账号,同一套系统、同一套话术流程,只要换一批名单来源、或者换一个拨打时段,结果就能差出好几倍。差距出在名单和时段,不在系统本身,所以单看一个数的高低没有意义,要看它在自己这条线索链上是第几层掉的。
还有一点容易被忽略:接通率相近的两个账号,往下走的结果未必一样。平台上就有接通率差不多的两个账号,一个聊得下去的明显更多,另一个接起来就挂的占多数——前者还有得往下推,后者基本停在第一层。所以接通率是入场券,不是成绩单。外部服务商公开的手册里也会给出参考区间,那是它在特定场景下的统计,直接拿来当考核线会出问题。
拿一组假设数据把四层算一遍
下面这组数是假设的,只为演示算法,不代表任何行业水平。假设某个月:总投入 6 万元,拨打量 2 万次,名单 1 万条;接通 6000 次,其中最终接听到的是 5400 条线索;达到有效时长的通话 1800 次;筛出意向线索 360 条,实际被销售跟进 324 条;最后成交 18 单。
先算触达和交互两层。接通率是 6000 ÷ 20000 = 30%;按线索触达率是 5400 ÷ 10000 = 54%。两个数差这么多,是因为 1 万条线索平均拨了近 2 次,按次算会把重复拨打摊进分母,把接通率压低。有效沟通率是 1800 ÷ 6000 = 30%,说明接通的人里只有三成聊到了有效时长。
再算转化和价值两层。有效线索转化率是 360 ÷ 1800 = 20%;人工跟进率是 324 ÷ 360 = 90%;单条有效线索成本是 60000 ÷ 360 ≈ 167 元;按成交算,单个结果成本是 60000 ÷ 18 ≈ 3333 元。后两个数最值得拿出来讨论:一条线索 167 元、一单 3333 元,值不值取决于客单价和毛利,不看这两个数,前面所有的率都只是过程。
哪个数掉下来就去查哪一层
这四层的价值,在于把「效果不好」拆成可定位的问题。掉下来的位置不同,要动的动作完全不同:
- 接通率或按线索触达率偏低:先核名单和号码状态,看空号、停机、错号占比,再看线路和拨打时段
- 有效沟通率偏低:看开场前几秒说了什么、名单和话术是否对得上、有没有在客户不方便的时段打
- 有效线索转化率偏低:看识别有没有漏掉意向客户、知识库和话术分支是否够用
- 人工跟进率偏低:看线索有没有及时进到销售的队列、响应时效够不够、字段有没有写错
还有一类问题出在衔接上:AI 聊出了意向,但关键字段没正确写进系统,这条线索在销售眼里就等于不存在,前面的活全白干。虎迅客的号码清洗解决的是第一层的事——名单导入前先核一遍号码状态,把空号、停机的挑出去;CRM 管理系统解决的是最后一环——意向线索直接落进线索池,不靠中间导表接力。两头各堵住一个口子,中间几层的数据才有可能准。
和人工比之前先把口径对齐
和人工电销对比,最容易出错的是口径。前面那组数里,按次接通率 30%、按线索触达率 54%,说的是两件事:前者反映拨打效率,后者反映这批名单最终触达了多少人。同一份数据换个分母,结论可以完全反过来,所以对比之前必须先把口径统一。具体到一条线索:打了三次才接通,按次算这一条是 1 次接通 ÷ 3 次拨打,按线索算则是 1 条触达 ÷ 1 条线索;同一批名单里这种情况越多,两个口径的数字拉得越开。
人机对比也是同理。人工在单次接触上的转化通常更高,因为遇到复杂问题能随机应变;AI 的优势在同等预算下能触达更多人,把单条有效线索成本压下来。方向大体成立,但公开资料里能查到的多是单一场景的自测数据,样本有限,换行业、换名单未必成立。有外呼平台在其验收建议里把单通成本目标定在 1.5 元以内,这是平台按自身定价给出的参考值,换平台、换线路都不一样。更稳的做法是自己跑一组对照:同一批名单分两半,一半交给 AI,一半照原样人工打,直接比两个口径下的单条有效线索成本。
别在第二周就给 AI 外呼判死刑
系统上线初期数字不好看是正常现象,但「跑得越久自然越好」这个说法不成立。效果提升来自复盘和调整:把挂断节点的录音翻出来听,把识别错的意图补进知识库,把拨打时段按实际接通率重新排一遍,按月改一版话术。没有这些动作,跑三个月和跑三周不会有区别。
节奏上建议分阶段。先小批量跑,样本覆盖不同时段和不同客户标签,跑满几个工作日再下判断;之后逐步放量,每加一档留几天观察期,核心指标突然掉头就停下来查原因。真正让数字变好的是这期间的按周复盘和参数校准,不是时间本身——没有人做这件事,多跑一个月也不会自动变好。
关于效果评估客户最常问的问题
六个指标里最该盯哪一个
如果只能看一个,看单条有效线索成本,它把前三层的损耗和价值层的客单价都收进去了。但定位问题时不能只看它:这个数变差,可能是名单质量掉了,也可能是话术转化掉了,得回到前五个数里逐层看是哪一个先动的。
AI 外呼的转化率怎么算才算对
先定分母。转化率至少要拆成两个:有效线索转化率(意向线索数 ÷ 有效沟通数)反映筛选效率,成交转化率(成交数 ÷ 意向线索数)反映销售侧的承接能力。把两者混成一个「转化率」,出了问题没法定位。另外,别拿不同名单、不同时段的转化率直接比,口径不同,比出来的差异大多没有意义。
AI 外呼的获客成本多少算正常
没有通行标准,因为它取决于客单价和毛利。能算的是单条有效线索成本和单个结果成本,判断标准是这两个数有没有落在你的毛利空间里。一个粗略的用法:单个结果成本明显低于一单毛利,同时人工跟进率在可接受范围内,这套系统就是划算的;否则先回去看是哪一层在漏。
之前没统计过基线拿什么比
上线前用同一批样本做对照:同一份名单,一部分交给 AI 打,一部分照原样人工打,把两边的接通、有效沟通、线索量放在一起看。上线前要想清楚要验证什么——目标场景、月任务量、历史基线、现有系统和必须验证的结果,这五项先落到纸面上,比事后补数据有用得多。
评估不需要复杂工具,难的是把数据按层分开。可以把最近一个月的失败和流失原因拉出来,按触达、交互、转化、价值归一下类,先看哪一层掉得最明显,再决定是补名单、改话术还是抓跟进。虎迅客能对上这套框架的是号码清洗、AI 大模型外呼机器人和 CRM 管理系统:前者管名单进系统前的号码状态,中间管拨打和沟通,后者管线索落库与跟进。多数团队第一轮就能定位到问题卡在哪一层,而不是继续在拨打量上做文章。