Jul 29, 2026温度计与恒温器:让 eval 真正改变下一步的那一层一个 agent 可以写得漂亮、条理清晰、数字精确到小数点后一位——而那个数字是它在搜索返回空之后自己填上的。只看行文,你永远抓不出来。这篇编译讲的是那个能抓出来的层:让判决改变下一条边的六条路由、从 25 条 trace 挖出第一条 eval、自动合并的四个信号、本周就能建的五条 eval。附我核回来的一手盲测数据——以及原文引用它时删掉的两行。译文精选 · 10分钟阅读
Jul 15, 2026让沙子学会思考之后:Demis Hassabis 的前沿 AI 治理框架Google DeepMind CEO、2024 诺奖得主 Demis Hassabis 说 AGI 大概只有几年之遥。但这不是又一篇 AGI 焦虑檄文——他给出一套具体、技术导向的机制:仿 FINRA 的「标准机构」、发布前 30 天预审、Frontier-class 门槛、季度更新的 held-out 测试、第三方审计。读完你会拿到两样能直接用的东西:一张判断前沿模型供应链走向的地图,和一套可以照搬进自己 agent 评测的方法论。译文精选 · 11分钟阅读
Jul 14, 2026反向信息悖论:在 AI 时代,先泄密的是买方微软 CEO Satya Nadella 把 Arrow 1962 年的「信息悖论」翻了个面:AI 时代先泄密的不是卖方,是买方。你为智能付两次钱——一次用钱,一次用为了让它好用而必须交出去的独门知识。读完你会拿到一条「信任边界」和五个 C 的检查清单,下周需求评审就能用。译文精选 · 9分钟阅读