- 横向验收任何一个 AI 产品:一张八层检查表
判断一个 Agent 能不能上线,不该看它演示得多聪明。把产品拆成任务、上下文、能力、编排、执行、验证、状态、信任八层逐项问过去,任一层答不上来,就是那个洞。
16 min read - 自治等级不是模型说了算,是能不能撤销说了算
给 Agent 多少自由度,判断依据不是模型看起来多聪明,而是动作的确信程度和撤销代价。L2 自治不是配置项,是幂等键、撤销窗口、补偿接口和审计工程出来的。
15 min read - 可验证性就是能力边界
生码只占研发链路 20% 到 30%,口径是需求到上线里写代码这段的耗时占比,继续优化它的边际收益已经很低。Agent 能走多远,取决于你能给它多少真实反馈——构建、测试、部署、日志、监控,缺一样它就只能靠训练分布猜。
16 min read