- 让 Agent 给自己打分,评测集就开始变成作弊集
自进化闭环一旦转起来,分数的含义就变了:题变窄、判据泄漏、模型给自己答案打高分,都能让曲线向上而能力不动。这篇写怎么给闭环装一根模型碰不到的尺子,也写闸门不装时分数往哪走。
16 min read - 先画依赖图,再写评测:你的指标会互相污染
三个指标同时掉,往往只是一个根因被记了三次。评测体系的顺序错了:先把执行依赖图画出来,再规定每个指标在什么条件下可评,才轮到 Judge 和门禁。
15 min read - 可验证性就是能力边界
生码只占研发链路 20% 到 30%,口径是需求到上线里写代码这段的耗时占比,继续优化它的边际收益已经很低。Agent 能走多远,取决于你能给它多少真实反馈——构建、测试、部署、日志、监控,缺一样它就只能靠训练分布猜。
16 min read