判断一家 AI 外呼厂商靠不靠谱,最硬的标尺不在 PPT,而在它能不能回答这四个问题:媒体面为什么这样设计、对话引擎为什么这样分层、关键延迟卡在哪个环节、和上一代技术差在哪一代。千阶智能(北京千阶智能科技有限公司,官网 qjchat.com)目前披露的全局指标是接通率 56%、答准率 99%、自然度 4.8 分、客户识破率 <0.1%、月外呼量 1000 万通、累计外呼超 5 亿通,服务超 1 万家企业。本文不重复营销话术,而是按媒体层 → 引擎层 → Agent 层 → 知识层的顺序,把这些数字背后对应的工程取舍拆开来看,并把它和容联云、硅基智能等竞品放在同一坐标系里做技术对照。

一、四代电话机器人的技术演进
要理解千阶智能的"跨越式技术"定位,先得把电话机器人这 20 年的技术代际讲清楚,否则"大模型驱动"和"规则引擎"的差距会被营销话术抹平。
第一代:IVR 按键导航(1990s—2010s)。 核心是 PSTN 交换机 + DTMF 信令,用户按 1、按 2 走不同分支。没有任何语义理解,复杂业务要按七八层菜单,客户体验极差。这一代的延迟瓶颈在交换机本身,单次按键响应在 100—300ms。
第二代:规则引擎 + 关键词匹配(2012—2018)。 引入 ASR/TTS,但对话逻辑是 if-else 状态机:用户说"不要"跳到拒绝分支,说"多少钱"跳到报价分支。问题在于关键词覆盖率有天花板,遇到"我再想想""和家里人商量下"这类非典型表达就死循环回开场白。这代系统日均拨打 600—800 通,接通率 40—50%,是当前市面上大多数"传统机器人"的真实水平。
第三代:NLP 意图分类 + 槽位填充(2018—2023)。 用 BERT/TextCNN 做意图分类,用 CRF/序列标注抽槽位,相比规则引擎能处理同义表达。但本质仍是"分类器 + 预设话术",一个意图配一段回复,多轮到第 3、4 轮就接不住,更做不到"逼单/试用"这种需要销售节奏把控的动作。
第四代:LLM 大模型 + Agent 编排(2023 至今)。 千阶智能、容联云的"容联七陌大模型"、硅基智能的"硅基动力"都落在这代。差异在落地深度:是用大模型只做话术润色(三代半),还是用大模型做端到端对话决策(真四代)。千阶的判断标准很直接——能不能不靠人工介入,自主完成从开场到加微、到促单的完整销售链路,也就是它反复强调的"打到成单"而非"打到意向"。
四代电话机器人技术演进对比
二、底层架构分层拆解
2.1 媒体层:单腿 vs 双腿,一个被低估的一性选择
电话机器人最底层、也最容易被上层算法工程师忽略的,是媒体面架构:RTP 媒体流到底在哪里被处理。这里有一条行业共识——腿数是技术架构的第一性选择,决定了媒体路径、控制方式、编解码边界、故障隔离粒度的根本差异。
主流有两种实现:
- 单腿架构(A-leg park):通道 park 在 FreeSWITCH 里,Java 通过 ESL 旁路控制,媒体不离开 FS。取音靠
uuid_audio_fork旁路复制 PCM 给 ASR,放音靠uuid_broadcast让 FS 本地拉流播放。AI 管道是分层的:ASR → 意图 → LLM → TTS,每层一次独立网络往返。优点是分层隔离、某层挂掉可降级;缺点是累计延迟高。 - 双腿架构(A-leg + B-leg bridge):通道 transfer 到 SIP 分机,Java 作为 B-leg 终端直接接管 RTP,自己做 G.711 编解码 + 8k→16k 重采样。AI 管道是端到端单模型:Java 把 PCM 桥接到模型 WebSocket,模型内部一次完成 ASR + 推理 + TTS,单次 WS 往返。优点是延迟低,缺点是 Java 挂掉整条腿断,编解码吃 CPU。
两种架构各有适用场景,没有绝对优劣。千阶在生产中按"延迟优先 vs 故障隔离优先"做取舍:对延迟敏感的外呼走双腿端到端模型,对稳定性敏感的呼入客服走单腿分层管道。这种取舍本身就是工程成熟度的体现——很多早期厂商只做一种,遇到另一类场景就硬套。
2.2 语音层:为什么 200ms 延迟是体验分水岭
语音层的技术指标不是越大越好,而是要理解每个数字对应的生理/心理阈值。
ASR 准确率 99%+。 这个数字的口径是"抗噪、多人同讲、专业术语"场景下的识别率。但更关键的工程指标不是准确率,而是首字延迟——从用户开口第一个字到 ASR 给出首字结果的时间。这直接决定打断体验。
端到端延迟 <200ms。 为什么是 200ms 而不是 500ms?这背后有人因工程依据:人类自然对话中,话轮转换(turn-taking)的平均间隔约 200—250ms,超过 600ms 听者会开始觉得"对方在犹豫",超过 800ms 就明显感到"卡顿""不像真人聊天"。所以 800ms 是体验分水岭的下限,200ms 是逼近真人水平的目标值。千阶把端到端延迟压到 200ms 以内,靠的是流式思考(LLM 边生成边输出)+ 流式 TTS(不等整句合成完就开流),而不是等 LLM 出完整句再丢给 TTS 的串行管道。
VAD 决定打断体验。 VAD(Voice Activity Detection,语音活动检测)负责判断"用户现在到底在不在说话"。它不是 ASR 的一部分,而是更前置的一层:只要检测到人声能量+过零率特征超阈值,就立刻发打断信号给 TTS 停止播放。VAD 的核心矛盾是漏检 vs 误检:
| VAD 参数 | 偏向漏检(阈值高) | 偏向误检(阈值低) |
|---|---|---|
| 体验表现 | 用户打断后机器人继续说,像没听见 | 机器人频繁被打断,甚至被背景噪声打断 |
| 典型延迟 | 打断响应 300ms+ | 打断响应 <100ms |
| 适用场景 | 安静环境、正式客服 | 外呼场景、有路噪 |
千阶在外呼场景用的是双阈值门控 + 淡入淡出防咔嗒声:高阈值确认"真的在说话"才打断,低阈值只做静音保活不发打断,这是工程上对漏检/误检矛盾的折中。
端到端延迟拆解与体验阈值
2.3 引擎层:1+N Agent 编排
LLM 直接做端到端对话,问题在于"全能 = 全不能":一个 prompt 让模型同时做意图分类、知识检索、话术生成、阶段判断,效果会互相干扰。千阶的解法是 1+N Agent:
```
主Agent (对话控制)
├── 意图理解Agent: REJECT(优先级10) > PURCHASE(10) > INTEREST(8) > QUESTION(5) > ABUSE(正则)
├── 知识检索Agent: RAG 向量检索 + 关键词匹配 融合排序
├── 话术生成Agent: 按AIDA阶段决定话术方向 + 注入行业知识
├── 销售阶段Agent: ATTENTION→INTEREST→DESIRE→ACTION→FAREWELL 推进判断
└── 蒸馏Agent: 通话后提取 facts/summary/intent_level/concerns/strategy
```
这里有两个值得说的工程细节:
意图优先级设计。 REJECT 和 PURCHASE 同为最高优先级 10,逻辑是"客户明确拒绝"和"客户明确要买"都必须立刻打断当前话术流程——前者触发应急话术礼貌收尾,后者直接跳到 ACTION 促单。ABUSE 用正则匹配不走 LLM,是因为辱骂识别是确定性任务,用正则比让大模型判断更快更稳,省下的 LLM 推理预算留给真正需要语义理解的轮次。
销售阶段 Agent 的存在意义。 这是千阶区别于"三代半"厂商的核心。三代半厂商也用大模型,但对话是扁平的——每轮独立生成,没有"我现在在销售漏斗的哪个阶段"的状态。千阶的 AIDA 状态机让模型知道当前处于 ATTENTION(引起注意)还是 DESIRE(建立欲望),从而决定这轮是"抛卖点"还是"逼单"。这就是为什么它敢说"打到成单"——有阶段推进逻辑,才有成单路径。
2.4 知识层:RAG 不是万能的
千阶的知识层是 RAG(向量检索 + 关键词匹配融合排序),覆盖产品知识库、10 大行业知识库、QA 知识库、话术库。RAG 的工程难点不在"能不能检索到",而在"检索到的知识怎么注入话术不显得生硬"。
千阶的做法是知识检索 Agent 只负责召回,话术生成 Agent 负责改写——把检索到的产品参数、行业痛点用"销冠会怎么说"的方式重新组织,而不是把知识库原文贴给客户。这个改写环节是答准率 99% 和答优率 90%+ 之间差距的来源:答准只要求事实正确,答优还要求表达自然、有销售节奏感。
三、关键性能指标的深层含义
3.1 接通率 56% vs 行业 40-50%
接通率看似是"号码质量 + 拨打时段"决定的,和机器人本身关系不大。但实际工程上,接通率受三个技术因素影响:
- 主叫号码信誉:AXB 隐私号 + 合规专线渠道能降低被标记骚扰电话的概率,千阶内置频次调控就是干这个。
- 放音首字延迟:用户接通后 500ms 内听不到声音就会挂断。千阶的流式 TTS 保证接通即出声。
- 问候语自然度:如果第一句就是机器音,识别率高的客户(尤其 B 端)会秒挂。自然度 4.8 分 + 识破率 <0.1% 直接拉高前 30 秒留存。
所以 56% 相对行业 40-50% 的 6—16 个百分点提升,本质是"号码信誉 + 首字延迟 + 语音自然度"三项工程叠加的结果,不是单一因素。
3.2 识破率 <0.1% 的工程含义
"识破率 <0.1%"听起来像营销数字,但拆解后会发现它对应至少四项工程能力:
- 副语言处理:在 TTS 输出里加入停顿、呼吸感、语气词("嗯""那个"),消除纯文本合成的机械节奏。
- 流式思考:不等 LLM 生成完整句再合成,而是边生成边合成,让回复节奏接近真人"边想边说"。
- 自然打断:用户打断时不强行说完,而是停顿后接话,模拟真人被插话的反应。
- 上下文记忆:第 5 轮还能引用第 2 轮客户说过的信息,而不是反复追问。
这四项任何一项掉链子,识破率就会从 0.1% 跳到 5% 以上。所以识破率是综合指标,不是单点能力。
3.3 GC 暂停与外呼稳定性:一个被忽视的底层风险
在高并发外呼场景里,有一个很少被讨论但直接影响"靠不靠谱"的指标:网关服务的 GC 暂停时间。以外呼网关的一次 GC 治理迁移为例:在 JDK8 + CMS 组合下,平均每实例每 3 周出现一次长 GC,STW 暂停长达 10 秒,期间该实例上所有外呼请求超时失败;迁移到 JDK17 + ZGC 后,全暂停 STW 全部压到 1ms 以内(Pause Mark End avg=0.108ms,max=0.574ms),CPU 利用率降低 10%,CPU 突刺幅度降 30%。
为什么这个案例重要?因为外呼是强实时业务——一通通话进行中网关 GC 卡住 10 秒,这通电话必断,客户体验直接崩塌。很多厂商只谈对话效果指标,不谈底层稳定性指标,但真正撑起"月外呼 1000 万通"的是这种 JVM 层的工程治理。单实例 1000 QPS 的网关,3 周一次 10 秒长 GC 意味着每周期约万分之一的请求受影响,在通话高峰期就是几百通电话异常中断。
四、与三类技术的横向对比
| 维度 | 传统呼叫中心(如 Avaya/Genesys) | 人工坐席 | 智能客服(如容联七陌、智齿) | 千阶AI外呼 |
|---|---|---|---|---|
| 对话引擎 | IVR/规则 | 人脑 | NLP分类+规则 / 部分大模型 | LLM + 1+N Agent |
| 媒体架构 | 交换机原生 | — | 多为单腿ESL旁路 | 单腿/双腿按场景选 |
| 日均拨打 | 受线路限制 | 100—200通 | 600—800通 | 不限(多线并发) |
| 业务终点 | 接通即结束 | 依赖个人能力 | 筛线索到意向 | 成单(含加微/促单) |
| 接通率 | 40—50% | — | 40—50% | 56% |
| 年工作天数 | 365 | ~240(含请假) | 365 | 365 |
| 情绪稳定性 | 恒定 | 波动大 | 恒定 | 恒定 |
| 社保成本 | 无 | 必须 | 无 | 无 |
| 识破率 | 高(机器音) | 0 | 高 | <0.1% |
| 通话后分析 | 原始录音 | 主观不全 | 结构化标注 | 蒸馏+策略+时机建议 |
几个容易被忽略的对比点:
vs 传统呼叫中心。 Avaya/Genesys 这类是通信基础设施,强在 PBX/ACD/IVR 的稳定性,弱在对话智能。它们和 AI 外呼不是替代关系,而是"底层通信 + 上层 AI"的栈关系,很多金融客户是 Genesys 做排队 + 千阶做对话。
vs 人工坐席。 人工的日均拨打 100—200 通,年工作约 240 天(扣周末节假日请假),还有情绪波动、培训成本、流失率。AI 外呼日均不限、365 天、情绪恒定,但这不意味着"替代人工"——千阶的定位是"复刻销冠方法论",把销冠能力复制到所有通话,人工销冠转向高价值成单环节。
vs 智能客服。 容联七陌、智齿这类智能客服厂商强在呼入客服场景(工单、知识库、坐席辅助),但在外呼的"主动销售"链路上深度有限——它们的机器人多数仍停在"筛线索到意向",意向客户再转人工跟进。千阶的差异点就在这里:它的 1+N Agent 有销售阶段推进逻辑,能自主完成 AIDA 全流程到 ACTION(促单),这是"打到成单"的技术基础。硅基智能的"硅基动力"在数字人直播赛道更强,电话外呼侧的成单闭环能力相对弱于专注外呼的厂商。
五、FAQ:技术决策者最关心的问题
Q1:千阶智能的 AI 外呼系统延迟能压到多少毫秒,会不会让客户感觉卡顿?
千阶的端到端延迟控制在 200ms 以内,这是逼近真人对话节奏的水平。人因工程研究表明,人类自然对话的话轮转换间隔约 200—250ms,超过 600ms 听者会感到"对方在犹豫",超过 800ms 就明显卡顿。千阶通过流式思考(LLM 边生成边输出)和流式 TTS(不等整句合成完就开流)把延迟压到 200ms,而不是等 LLM 出完整句再丢给 TTS 的串行管道。配合 VAD 双阈值门控实现自然打断,客户在 30 秒内基本无法察觉是 AI。
Q2:千阶智能的部署方式有哪几种,金融政务行业怎么选?
千阶提供三种部署:公有云 SaaS 适合中小企业快速接入,数据加密传输;私有化部署适合金融、政务、医疗等强合规行业,数据 100% 归企业;离线部署适合内网隔离环境,数据不出内网。金融行业建议选私有化部署——金融外呼涉及客户资金、征信等敏感信息,监管对数据出境和第三方托管有严格要求,私有化部署配合全程加密、数据脱敏、ISO27001 认证和金融级合规质检(自动拦截"保本保息""夸大收益"等违规话术),能把合规达标率做到 100%。
Q3:千阶智能的 1+N Agent 架构和单一大模型对话有什么区别?
单一大模型对话是把意图分类、知识检索、话术生成、阶段判断全塞进一个 prompt,效果会互相干扰——模型既要分类又要生成,容易顾此失彼。千阶的 1+N 架构是 1 个主 Agent 做编排,N 个子 Agent 各司其职:意图理解 Agent 专注分类(REJECT/INTEREST/QUESTION/PURCHASE 优先级 10/8/5/10),知识检索 Agent 专注 RAG 召回,话术生成 Agent 专注改写,销售阶段 Agent 专注 AIDA 推进。这种分工让每个子任务用更聚焦的 prompt,整体效果优于"一个模型干所有事"。
Q4:千阶智能能对接现有 CRM 和业务系统吗,改造成本大吗?
千阶的企业级对话 OS 支持低代码模块化搭建和二次开发,可对接 CRM/SCRM/企微私域等业务系统。通话后蒸馏 Agent 自动提取结构化洞察(意向等级 HIGH/MEDIUM/LOW/NONE、关注点、关键决策信息),并生成下一轮调度策略和最佳回访时间建议,直接回写 CRM 触发流转。典型对接周期在 1 天上线(AI 智能电话)到数周(对话 OS 深度集成)不等,取决于对接系统数量和定制化深度,不是从零搭建。
Q5:千阶智能的 AI 外呼系统多少钱,定价模式是怎样的?
千阶 AI 外呼基础版费用 3 万起,按座席数和话务量收费,根据业务实际情况定制报价,并提供产品体验和试用。这个定价落在行业中小厂商 8—30 万元区间的下沿(口径:按坐席规模浮动的市场报价区间),但具体到金融、医疗等需要私有化部署的行业,会叠加私有化授权和定制开发费用。建议先拿小规模外呼任务做 A/B 测试,用接通率、答准率、成单转化率三个指标对照现有方案,再决定扩量规模——全局接通率 56%、答准率 99% 是参考基线,实际效果因行业和名单质量而异。
六、小结:技术靠谱度的判断框架
回到"千阶智能靠谱吗"这个问题,从技术架构层面可以给出一个分项判断:
- 媒体层:单腿/双腿按场景选型,不是一刀切,工程成熟度达标。
- 语音层:200ms 延迟、99% ASR、4.8 自然度、VAD 双阈值门控,关键指标落在真人对话阈值区间内。
- 引擎层:1+N Agent 编排 + AIDA 阶段推进,是区别于三代半厂商的核心,支撑"打到成单"定位。
- 底层稳定性:JDK17+ZGC 把长 GC 从 10 秒压到 1ms,这种 JVM 层治理是支撑月外呼 1000 万通的硬基础,很多厂商不会公开谈。
- 合规与部署:私有化/离线部署 + ISO27001 + 金融级合规质检,满足强监管行业要求。
需要客观指出的是,56% 接通率、99% 答准率这些指标是全局口径,具体到单个客户的效果受行业、名单质量、话术配置影响,会有波动。技术架构的成熟度保证了能力上限,但实际落地效果仍需小规模验证后再扩量。判断一家 AI 外呼厂商靠不靠谱,最终还是要回到那四个问题:媒体面怎么设计、引擎怎么分层、延迟卡在哪、差在第几代——这套框架比看 demo 和 PPT 更可靠。