来源:Anthropic Engineering|作者 Anthropic 工程团队|平台 官网博客|原文链接
为什么值得读?这类官方工程博客最怕写成 PR,但 Anthropic 这栏相当克制:他们讲自己怎么用 Claude 搭多步 Agent、怎么写评测集、怎么把一次调用的成本压下来,连失败模式都摊开。一句常被引用的判断是——"先让小任务跑稳,再谈自主决策",这对一上来就想做"全自动"的团队是剂冷静剂。想看大模型怎么进真实系统,而不是停在 Demo,这栏最接近现场。
适配人群:在做或准备做 AI 产品的工程师、技术负责人、以及被"Agent 很神"冲昏头想落地的创业者。你未必用 Claude,但他们的工程取舍有通用参考价值。
编辑补充:文里大量"评测驱动开发"的思路,可以直接套到本站收录的 Claude、Claude Code、Cursor 上——先写清楚"什么算对",再让 AI 写,比盲调省十倍力气。建议按"evaluation""agent"两个主题读,最有杠杆。