Jul 5, 2026一个漂亮的做对率,盖住了几十个会动钱的错——上线判定该怎么读数我带过的一个资损项目,总做对率报得很好;可把资损意图单独拆出来一算,误操作率高得吓人,几十个会动钱的错一直留着——一个总数把它们全藏住了。读完 5 分钟能识破「一个准确率申请上线」的陷阱,10 分钟能给会动钱的错单独设一道盯误操作率的闸,20 分钟能搭出「看 CI 下界 + 逐场景切旧账 + 分渠道放量」的上线判定流程。Agent 上线之后 · 17分钟阅读 · 中 · EN
Jul 5, 2026让 agent 越用越准,而不是越用越笨——数据飞轮怎么转起来标注里我们发现开学季促销问的人巨多,但其中「送赠品怎么领」一直没答好——于是针对性补了 KB,下一轮这类就上来了。这就是数据飞轮。读完 5 分钟能看清前五篇其实是一个轮子的五根辐条,10 分钟能识破「飞轮空转」(数据堆成山却从不 ship)的根因,20 分钟能拿到一套按 频率×代价 排序、还会逼你拆分意图的回流流程。Agent 上线之后 · 16分钟阅读 · 中 · EN
Jul 5, 2026看板全绿,agent 却在悄悄变笨——上线之后的静默退化在一家消费级科技公司做客服 Agent,我盯指标盯出一个反直觉的认知:它从来不是一条平线。每次新品发布、每个开学季,问题分布就变、涌现一批新问法,agent 悄悄变笨——而 CPU / QPS / 延迟全绿的看板上一个像素都看不到。读完 5 分钟能识破「看板绿 = 健康」的错觉,10 分钟能列出 6 个比客诉早几周报警的 leading 信号,20 分钟能把评估集从「冻在上线那天」改成持续从当前流量重抽。Agent 上线之后 · 17分钟阅读 · 中 · EN
Jul 4, 2026标注是 ground truth——「换个大半码」这一句,两个客服能标出三个答案客户一句「想换个大半码」,埋着四个必须判的分叉:换货还是退货、走不走物流拦截、要不要补差价、按哪个价补。两个熟练客服背对背标同一批 50 条,只对上 35——你那个 96% 准确率,是拿一把 70% 自相矛盾的尺子量出来的。读完 20 分钟能拿到一套先测一致率、再把「补差价按哪个价」这类写进 rubric 的落地流程。Agent 上线之后 · 17分钟阅读 · 中 · EN
Jul 3, 2026标了 50 条、96% 做对,能上线吗?——标注量该看 CI 下界,不看那个漂亮数字「标了 50 条,96% 做对,能上线吧?」——不能,统计下界只有 86%。我给客服 Agent 设计标注准入时,第一条拍死的规则就是:看置信区间下界,不看点估计。读完 5 分钟能识破小样本 96% 的假达标,10 分钟能拿到一张「真实做对率 → 该标多少条」的爆炸表,20 分钟能搭出一套 CI 停止准则——该多标的多标、达标的别浪费、标到某个点该停手回去改 agent。Agent 上线之后 · 16分钟阅读 · 中 · EN
Jul 2, 2026随机抽样报的 96%,按渠道一拆就红了——评估集抽样的两种致命失效供应商随机抽 200 条报「准确率 96%」。我把这 200 条按渠道拆开,抖音公域那格里差价类几乎全错——大流量的私域把它稀释成了漂亮数字。读完 5 分钟能识破随机抽样的两种失效(漏长尾 + 大渠道稀释小渠道),10 分钟能问出让评估集现原形的抽样问题,20 分钟能拿到一张渠道下钻 + 风险层过采样的分层抽样框。Agent 上线之后 · 18分钟阅读 · 中 · EN