随机抽样报的 96%,按渠道一拆就红了——评估集抽样的两种致命失效

《Agent 上线之后》系列第一篇。《Agentic AI 落地方法论》讲的是怎么把一个 agent 造出来、送上线;这个新系列讲的是上线之后——采样、标注、评估、信号回流这一整套让 agent 持续做对的机制。它是当前企业 agent 市场最大的空白,也是最难被 demo 掩盖的真功夫。第一篇从最不起眼、却最先暴露落差的一步说起:采样。English version: Sampling Your Agent's Evaluation Set。
你以为 AI 越强、越不需要人?恰恰相反——真金白银在做 agent 的地方,标注和评估团队不减反增(中国 AI 基础数据服务市场 2019 到 2025 年复合增速约 47%,到 2025 年底专业标注人员达 9.5 万)。一线公司在逆势扩建千人级评估团队,因为 Agent 上线,才是评估真正开始的地方。而大多数项目,上线就放养了。
放养从哪一步开始?从你怎么抽那几百条评估样本开始。
这一年我带一个零售鞋服的客服 Agent 项目,供应商每周邮件报「评估准确率 96%」。我要来那份评估集,只问了一件事:这 200 条怎么抽的?答:线上流量里随机抽的。
我做了一件他们没做的事——把这 200 条按渠道拆开。私域占了绝大多数,抖音公域只有二十几条。私域那格 95%,漂亮;可公域那二十几条里,几条「买贵了退差价」全错了:抖音公域根本没有价保政策,agent 却照着私域的话术答「可以帮您申请」。
把 96% 按渠道拆开的那一刻,抖音公域那格从绿变红——全场才发现,供应商那个漂亮数字,从来没分过渠道。 私域的大流量,把公域正在翻车的高危意图,加权稀释成了一个能过闸门的 96%。
这就是随机抽样的真相:它不只是不准,它会用最「公平」的方式,把你最该看见的风险藏起来。而采样,恰恰是整个评估体系的第一块砖。
随机抽样的第一种失效:漏掉稀有高危的长尾
随机抽样测的是最常见的,而 agent 真正会出事的地方,恰恰最稀有。
生产流量极度长尾。客服 Agent 一天几万条对话,九成是「物流到哪了」「怎么退货」这类只读查询;真正让人半夜接电话的,是那几个会动钱的写操作——退款、取消订单、改收货地址、拦截物流。这类高风险请求,往往只占全天流量的千分之几。在随机抽的 200 条里,它们的期望出现次数是 0 到 1 条。
随机抽样把评估投入按流量平均分——于是最该被盯住的高危写操作,被稀释进了统计噪声。于是面板上写着 96%,但它测量的几乎全是 agent 最不容易出错的部分——常见的、只读的、无关金钱的对话。而你真正睡不着的那类风险:退错一笔钱、错放一单合规,它的真实错误率,完整藏在那一百多条你从没抽到的样本里。一个评估指标的可信度,上限不由模型决定,而由你的抽样框决定。
随机抽样的第二种失效:大渠道把小渠道的事故稀释掉
随机抽样还会犯第二个、更阴的错——把不同渠道混进一个数里,让大流量渠道盖住小流量渠道的翻车。 开头那个 96%,栽的就是这一种。
渠道是做对率的真实变量:不同渠道的知识库来源、政策口径(换货 / 运费险 / 小额退 / 价保)、检索能力都不一样,同一个意图在不同渠道的正确答案都可能不同。私域会员有价保、抖音公域没有——同一句「可以帮您申请退差价」,私域对、公域错。
把两个渠道混进一个随机样本里,流量大的私域会把流量小的公域的问题加权稀释掉,总数看着过了 90%,其中公域其实在翻车。更糟的是,抖音公域刚上、流量小,随机抽连 30 条地板都够不着——这个正在翻车的渠道,在评估里根本不存在。
私域大流量把公域的翻车加权成 96%——每个渠道要各自成框、各自过闸,某渠道达标才放量那个渠道。所以评估集不能混着抽,要按渠道下钻成框:每个渠道各自成框、各自判,某渠道达标才放量那个渠道——而不是靠一个跨渠道的总数一刀切。
解药是一张分层的框:渠道下钻 + 风险层过采样
先把结论摆桌面上:评估集不按流量占比随机抽,而按「渠道 × 意图 × 出事代价」分层——大流量常见意图意思一下,稀有高危意图故意过采样。
一张能用的抽样框,逻辑长这样:
for 渠道 in [私域, 抖音公域]: # 渠道下钻:各自成框、各自过闸
for 意图 in 意图集(渠道):
if 意图 in 资损写操作: # 退款/取消/改地址/改单号/催发货/拦截物流…
全采(意图, 渠道) # 不抽样,上限 150;能亏钱的一条不漏
else:
抽到CI下界过90%(意图, 渠道, 地板=30) # 咨询类,抽到能下结论就停
两条纪律:
- 风险层故意过采样。 会动钱的写操作单独拎出来,过采样到评估集的 30% 以上——一次退错钱的代价,不等于一次「物流到哪了」答错的代价,评估投入凭什么按流量平均分。
- 每个「意图 × 渠道」是独立一格。 各自计数、各自过闸,不满 30 条显示「样本积累中」,绝不用一个混合数糊过去。
以一周约 3000 通会话为例:资损约占 20%(≈600 通、7 个意图)、咨询约 80%(≈2400 通、约 15 个意图),首轮全量标注 ~1500 条就够——而且这 1500 主要是私域;抖音公域刚上、多数格子还没够 30 条地板,先单独攒、单独判,不并进私域分母。这也是为什么分层抽样最省人力:标注量随「意图数 × 渠道数」增长,不随流量增长。
有一类采样,必须对 agent 保密
这一层几乎没人想到,但它是把评估和「刷分」区分开的关键。
只要 agent 或供应商知道哪些样本会被抽查、被评分,评估就会被优化成讨好抽查集,而不是把事情做对。 这不是阴谋论——任何被度量的系统都会朝着度量的方向漂移。如果每次评估都固定抽那批意图、那批渠道,时间一长,优化就会精准压在「被看见的地方」,而看不见的角落继续烂。这正是 reward hacking 在评估环节的翻版:你以为在测能力,其实在测「对着已知考题的应试能力」。
所以两条操作纪律:抽样的具体样本要轮换、带随机性,别让它可预测;风险层要不预告地插进真实流量里做盲测。评估集可以是公开的方法,但不能是公开的题库。
这周能做的三件事
- 把评估集按渠道拆开重算一次。 任何一个混合的准确率,先按渠道拆开——某个渠道被大流量稀释掉的翻车,一拆就现形。这一步不用任何新工具,只用你手上那批样本。
- 给评估集补一张风险层 + 渠道框。 会动钱的那 7 个写操作意图过采样到 30% 以上;每个「意图 × 渠道」独立成格,设 30 条地板。把「按流量抽」改成「按渠道 × 代价抽」。
- 建固定基线集,分渠道判。 冻结一个带风险层、按渠道拆的评估集当基线;每次改动都在同一张集上重测,某渠道达标才放量那个渠道。
回到开头那条落差。一线公司为什么在 AI 越来越强的时候,反而扩建千人级的评估团队?因为他们早想通了:模型只决定 agent 的上限,而采样、标注、评估、回流这套机制,决定它上线之后会不会一路下滑。 Agent 上线不是终点,是评估真正开始的地方。
采样是这套机制的第一块砖。下一篇讲第二块——标注量:给定流量,到底标多少条才够,为什么答案不是「流量的百分之几」。
这一篇如果帮你把评估集从「随手混着抽」改成一张渠道 × 风险分层的框,回复关键词「抽样框」,我把那张分层抽样框模板 + 3 个评审会问题清单发给你。
正在做 agent?
把最糟的那段对话发我,免费拆解失败点。
评论
订阅
新文章第一时间送到邮箱。

