Aug 4, 2026Claude 5 时代的 context 工程新规则Anthropic 把 Claude Code 的 system prompt 删掉 80% 以上,评测上测不出损失。这篇讲清六条昨天的最佳实践今天各自换成了什么——规则换成判断力、例子换成接口设计、全塞前面换成渐进式披露——以及你的 CLAUDE.md、skills、references 各自该承担什么,哪些规则其实是在为旧模型的缺陷付费。译文精选 · 11分钟阅读
Aug 3, 2026记忆工程:让 agent 的记忆越用越聪明,而不是越用越臃肿读完能把 agent 的「记忆」从一个什么都倒进去的向量库,改造成会遗忘、会巩固、防得住投毒的四层结构——四类记忆分开存、情景巩固成规则、受控衰减而非定时删除、冲突降权带 provenance、来源信任下限随决策风险浮动。译文精选 · 13分钟阅读
Jul 29, 2026让一个 Obsidian 研究系统替你读完这周的资料《第二大脑》的下半场:知识存进去之后谁来治理它。核心是一条硬规则——agent 发现新材料和旧笔记打架时不许自动裁决,必须双向标记并停下来等人。外加 questions/ 文件夹、只读最近 7 天的 500 字周报、以及一套诚实度量「到底有没有省下时间」的方法。译文精选 · 15分钟阅读
Jul 29, 2026Loop Engineering 是一种模式,不是一个功能作者是他所推销那个产品的老板——但他那句判断是硬的:agent loop 里「这一轮该不该结束」不该由模型来答。模型做判断很强,做调度很差,而且是偶尔出错、不复现的那种差。附一张每步决策的耗时与成本对比,以及把编排沿技术栈往下搬的三级路径。译文精选 · 12分钟阅读
Jul 29, 2026Harness / Loop / Graph:agent 系统坏了,先分清坏在哪一层读完 12 分钟,你能把一个 agent 系统拆成三层——harness(运行环境)、loop(反馈)、graph(流程),拿到一张「症状 → 该修哪一层」的诊断表,和一份上生产前的自检清单。附译者核实:原文举的 graph 产品范例 OpenAI Agent Builder 已进入弃用倒计时。译文精选 · 12分钟阅读
Jul 29, 2026温度计与恒温器:让 eval 真正改变下一步的那一层一个 agent 可以写得漂亮、条理清晰、数字精确到小数点后一位——而那个数字是它在搜索返回空之后自己填上的。只看行文,你永远抓不出来。这篇编译讲的是那个能抓出来的层:让判决改变下一条边的六条路由、从 25 条 trace 挖出第一条 eval、自动合并的四个信号、本周就能建的五条 eval。附我核回来的一手盲测数据——以及原文引用它时删掉的两行。译文精选 · 10分钟阅读
Jul 15, 2026用 12 步造一个会拒绝自己幻觉的研究 agent:搜索循环、来源打分、事实闸一个失败的 agent 不是因为它笨,而是因为循环里没有一环被允许说「不」。12 步、三个循环、三道闸,造一个拒绝把自己幻觉当结论发出去的研究 agent——附一道 11 行、你今天就能抄进去的引用闸。译文精选 · 14分钟阅读
Jul 15, 2026让沙子学会思考之后:Demis Hassabis 的前沿 AI 治理框架Google DeepMind CEO、2024 诺奖得主 Demis Hassabis 说 AGI 大概只有几年之遥。但这不是又一篇 AGI 焦虑檄文——他给出一套具体、技术导向的机制:仿 FINRA 的「标准机构」、发布前 30 天预审、Frontier-class 门槛、季度更新的 held-out 测试、第三方审计。读完你会拿到两样能直接用的东西:一张判断前沿模型供应链走向的地图,和一套可以照搬进自己 agent 评测的方法论。译文精选 · 11分钟阅读
Jul 15, 2026企业财务的 AI 该怎么落地:别买平台,给「中间那个人」装个后台 agent给全公司发 Copilot,三个月烧掉 300 万 token 换来一座技术债坟场;买一堆点解决方案,ROI 不到 15%。第三条路:一个好 agent 大部分不是 AI——85% 代码、15% 模型,坐在你已有系统之上、之间,把中间那个人的活干了。一家客户月末结账从 12 天压到 5 天。译文精选 · 13分钟阅读
Jul 14, 2026反向信息悖论:在 AI 时代,先泄密的是买方微软 CEO Satya Nadella 把 Arrow 1962 年的「信息悖论」翻了个面:AI 时代先泄密的不是卖方,是买方。你为智能付两次钱——一次用钱,一次用为了让它好用而必须交出去的独门知识。读完你会拿到一条「信任边界」和五个 C 的检查清单,下周需求评审就能用。译文精选 · 9分钟阅读
Jul 8, 2026四种 Loop 分别什么时候用:Claude Code 官方的 loop 入门指南读完 8 分钟,你能分清 Claude Code 里回合制 / 目标制 / 定时制 / 主动制四种 loop 各自的触发方式、停止条件和适用场景,拿到一张『该用哪一种』的决策表,并知道怎么在不烧爆 token 的前提下把质量守住。译文精选 · 8分钟阅读
Jul 6, 2026用 Fable 5 搭一个自我改进的 agent 系统:14 步,loops、动态工作流、routines读完 15 分钟能判断自己的 agent 系统漏了哪几层复利:按复杂度路由四档模型、独立验证者打赢自我批判、5 阶段记忆写进 STATE.md、视觉自检、Mythos 安全边界兜底——外加一份「让 Fable 5 停在 10% 潜力」的自查清单。译文精选 · 15分钟阅读
Jul 6, 2026Loop Engineering:Karpathy 方法论,和那篇让它再快 5 倍的研究读完 10 分钟能判断自己该不该造 loop、看懂 Karpathy 的 autoresearch 为什么能整夜自己调模型、以及那篇把它再推快 5 倍的论文到底改了什么——还附一段你今天就能贴进任何 LLM 的 loop 提示词。译文精选 · 10分钟阅读
Jul 5, 2026用 Fable 5 搭一个第二大脑读完能把「知识库」从只做 RAG 检索,升级成一个 agent 自己编译、越长越强的链接式 wiki——四块结构(raw/entities/concepts/INDEX)、goal 回填、怀疑者验证、成本防火墙,一小时就能搭出最小版本。译文精选 · 14分钟阅读
Jul 5, 2026Fable 实战指南:找到你的未知读完能把「未知」拆成四个象限,并拿到一套在实现前/中/后逐步逼出未知的具体套路——盲点扫描、头脑风暴、访谈、参照物、实现笔记、小测验。Fable 时代真正的瓶颈不是模型,而是你澄清未知的能力。译文精选 · 12分钟阅读