
定制 AI Agent 试点 30 天:该看解决率还是该看「少惹祸」?
定制 AI Agent 试点最容易走偏的,是把「自动解决率」当成唯一 KPI。前 30 天若只追这个数字,系统与运营会一起学会:少转人工、模糊问题硬答成确定承诺、评测只留 happy path。结果是周报好看、客诉与错误承诺在放量后爆炸。正确做法是:伤害控制指标权重高于效率指标,解决率只作参考,通过门禁后再优化。GeonAI 的试点与放量以可验收指标为准;官网 /agents 仅为能力参考(363+ 预设非公众全量试用)。评估请邮件 [email protected]。完整 12 项见 /blog/poc-to-production-agent-checklist;边界三表见 /blog/custom-agent-scope-boundary-in-contract。
两类指标:效率 vs 伤害控制
| 类型 | 例子 | 试点前 30 天权重 |
|---|---|---|
| 效率 | 自动解决率、首响、人工时长节省 | 中 |
| 伤害控制 | 错误承诺、缺引用、越权/串库、漏转人工 | 高 |
| 体验辅助 | CSAT / 投诉升级单数 | 中高(作哨兵) |
效率指标不是无用,而是不能单独当放量钥匙。伤害指标不过关,解决率再高也不开下一入口。
建议的 30 天仪表盘(最小)
- 缺引用率:有事实断言但无文档版本/章节的占比
- 旧版文档命中率:命中已废止或过期版本的占比
- 越权 / 串库率:不应见的知识或系统被读到的次数(目标 0)
- 漏转人工率:应转未转(情绪、缺证据、表 C 动作)
- 错误承诺抽检率:改价/交期/退款等严重级抽检(目标 0 严重)
- 自动解决率:仅作参考;分母规则见下文
- 用户投诉 / 升级单数:周环比哨兵
知识与引用机制见 /blog/custom-agent-more-than-a-prompt、/blog/enterprise-rag-knowledge-base-agent。
「解决率」如何被刷高
- 降低转人工阈值,却未同步提高知识与工具质量
- 把模糊问题硬答成确定承诺(尤其交期、价格)
- 评测集只有 happy path,不含拒答与越权样例
- 把表 B 固定拒答算作「未解决失败」,倒逼模型少拒答
对策:自动解决率分母排除表 B 合规拒答;表 C 未经确认的外发/写库不计入自动解决胜利。合同与周报用同一套分母,避免两套账。
放量门禁(示例)
- 连续两周:缺引用率低于约定阈值
- 错误承诺抽检:严重级为 0
- 越权 / 串库:为 0
- 漏转率低于约定阈值,且工单字段完整率达标
- 以上通过 → 才开下一入口或提高流量;否则只允许修知识/规则,不扩面
门禁细节与证据要求见 /blog/poc-to-production-agent-checklist。ROI 测算应在伤害门禁通过后再谈,见 /blog/ai-agent-roi-calculator。
谁看周报、谁有否决权
- 业务 Owner:看投诉与解决效率
- 交付 / IT:看缺引用、工具失败、版本
- 合规或风控(若有):对越权与错误承诺有放量否决权
找 GeonAI 时怎么描述
给出试点入口、可接受的伤害阈值(例如严重错误承诺=0)、以及希望写入合同的放量门禁。邮件 [email protected]、服务方案 或 Live chat。
常见问题
业务只认解决率怎么办?
把伤害指标写成放量门禁;解决率作为门禁通过后的优化目标,而不是唯一验收线。
30 天不够怎么办?
流量低可延到有统计意义的样本量,门禁逻辑不变——不能用「样本太少」跳过伤害抽检。
没有标注团队怎么做抽检?
先做小样本双人抽检(如每周 50–100 条),优先覆盖改价、交期、退款与拒答样例。
表 B 拒答算不算拉低解决率?
合同写清后不应计入失败。拒答是规格行为;应单独统计「合规拒答率」。
和交付清单、边界三表什么关系?
交付清单规定要有验收指标表;三表定义可做/不做/须确认;本文说明试点 30 天该盯哪些数、如何防刷解决率。
CSAT 能不能代替伤害指标?
不能。CSAT 滞后且会被话术安抚;错误承诺与越权要用抽检与日志,不能只靠满意度。