标了 50 条、96% 做对,能上线吗?——标注量该看 CI 下界,不看那个漂亮数字

Yaqin Hei · · 16分钟阅读
EN中文

标了 50 条、96% 做对,能上线吗?——标注量该看 CI 下界,不看那个漂亮数字

《Agent 上线之后》系列第二篇。 上一篇《随机抽样报的 96%,按渠道一拆就红了》讲了抽哪些——渠道下钻、风险层过采样。这一篇接着回答下半场:每一格,到底标多少条才够。English version: How Much to Label

这一年我给一个零售鞋服的客服 Agent 项目设计标注准入,第一条拍死的规则就是:看置信区间下界,不看点估计。

规则是被一个反复出现的场景逼出来的。评审会上最常见的一句话是——某个意图标了 50 条,96% 做对,可以上线了吧?数字很漂亮,会议室里没人反对。

但 50 条里的 96%,统计意义上的下界只有约 86%。换句话说,你并没有把握它真做到了 90%——你只是「看着」做到了。小样本的点估计会骗人:样本越少,那个漂亮的百分比和它背后真实水平的差距就越大,而这个差距,恰好藏在你没标够的那些条里。

所以标注量的问题,从来不是「标了多少、准确率多少」,而是「标到能对上线门槛下结论了没有」。而这件事,藏着两个大多数团队没想清楚的东西:该标多少取决于什么,以及——什么时候该停。

50 条 96% 不能上线——小样本的点估计会骗人

一个准确率数字有两种读法:点估计(就是那个 96%),和置信区间下界(你有把握不低于的那条线)。上线该看的是下界,不是点估计。

为什么?因为点估计是运气的函数。50 条里对了 48 条,是 96%;但只要其中两条是碰巧对的,真实水平可能就在 86% 上下。样本越小,这种「碰巧」的空间越大。看下界,就是把运气从里面扣掉——它回答的是「最坏情况下我还有没有 90%」,而不是「这批样本恰好考了多少分」。

同样是 96% 点估计:50 条的置信区间下界只有约 86%,标到约 140 条才能把下界推过 90% 门槛

点估计是运气的函数——门槛之上有没有把握,不看你考了多少分,看你考了多少题。

同样是 96% 的点估计,50 条的下界大约在 86%,要把下界推过 90%,你得标到约 140 条。门槛之上有没有把握,不看你考了多少分,看你考了多少题。

这就是那条「看下界」规则的来历,也是一个当周就能用的检测动作:任何人拿一个准确率来申请上线,先问一句——这是点估计,还是置信区间下界? 答「就是标了 N 条算出来的」,那这个数还没资格进上线决策。

标多少条,取决于 agent 真实有多好——一张会「爆炸」的表

先把结论摆桌面上:该标多少条,不是拍一个死数字,而是取决于 agent 在这个意图上真实做得有多好——越贴近门槛,需要的样本量爆炸式增长。

我在项目里反复用的是这样一张对照表(门槛按「做对率下界过 90%」算):

agent 在该意图的真实做对率需标注 / 意图判读
100%约 35 条很划算
98%约 53 条划算
96%约 84 条可接受
94%约 204 条很贵
92% 及以下700 条以上,或永远过不了别标了,是 agent 要改

随真实做对率贴近门槛,需标注量爆炸式增长:100% 只要 ~35 条,94% 要 ~204 条,92% 及以下要 700+ 或永远过不了

门槛以下再标只是把人力烧在一个注定过不了的意图上——置信区间在替你喊停。

最关键的洞察在最后一行。真实做对率只有 92% 时,你标 700 条都未必能把下界推过 90%;真到了 90%,数学上永远过不了。这时候置信区间不是在为难你,是在诚实地告诉你一件事——不是数据不够,是 agent 不够好,标再多也白搭,得先回去改 agent。

这条线把「标注」和「改模型」分了工:门槛附近(96% 往上),多标能换来一个能上线的结论,值;门槛以下(92% 往下),再标只是把人力烧在一个注定过不了的意图上。一个健康的准入流程,应该在这里主动喊停,而不是让标注团队闷头标到天荒地老。

标注量是个动态过程:CI 停止准则

别给每个意图拍一个死数字(「都标 100 条」)——标注量应该由置信区间动态决定:该多标的多标,达标的别浪费,注定过不了的及时喊停。

我在准入里落的停止逻辑,长这样:

每标完一批 → 算 Wilson 下界 / 上界:
    下界 ≥ 门槛(90%)      → 达标,停,回落到常规抽检量
    上界 < 门槛(90%)      → 注定不达标,停,报「agent 需改进」
    区间跨在门槛两边       → 还没定论,下一批多抽一点,逼近结论
    样本 < 30 条(地板)     → 「样本积累中」,先攒几周再判

这套逻辑的好处,是把有限的标注人力自动投到最需要的格子上。一个意图如果轻松达标(真实做对率高),几十条就触到下界、当场停手;一个意图如果卡在门槛边上,系统会让你多标几批逼近结论;而一个真实做对率就在门槛下的意图,上界压不过 90% 的那一刻,CI 会直接告诉你「别标了」,把人力从一个注定过不了的坑里捞出来。

检测动作:问一句「我们每个意图标多少条,是拍的死数字,还是标到 CI 下结论就停?」答「统一标 100 条」的,说明你在好做的意图上浪费人力,在难做的意图上又没标够——两头都亏。

这周能做的三件事

  1. 把「点估计」从上线决策里赶出去。 下次谁拿准确率申请上线,问一句「这是点估计还是置信区间下界?」——只认下界,下界过门槛才算就绪。
  2. 把那张「真实做对率 → 该标多少条」的表拍进评审会。 让「该标多少」变成一个由数据决定的量,而不是拍脑袋的死数字;并且约定:某个意图标到几百条下界还不过,就停手、报「agent 需改进」,别再往里填人力。
  3. 给标注量接上 CI 停止准则。 每批标完算一次下界 / 上界,按上面四条分支决定停、继续、还是叫停——把标注人力自动导向最需要的格子。

回到开头那个问题。「标多少条才够」之所以让人答不上来,是因为大多数人把它当成一道流量题,而它其实是一道「你有多大把握」的题。把标注量绑在 CI 上,你会同时拿到三样东西:一个诚实的上线闸门、省下的人力,以及一个会主动告诉你「别标了、该改 agent 了」的信号。

下一篇讲这套机制里最容易被当脏活、其实是 ground truth 的一环——标注本身:谁来标、怎么标、当两个人标同一条不一致到 30% 的时候,你手里的「标准答案」到底还算不算数。


这一篇如果帮你把「标多少」从拍脑袋变成一套会喊停的 CI 准则,回复关键词「标注量表」,我把那张「真实做对率 → 该标多少条」对照表 + CI 停止准则模板发给你。

正在做 agent?

把最糟的那段对话发我,免费拆解失败点。

获取拆解 →

评论

订阅

新文章第一时间送到邮箱。