About
电子科技大学 27 届在读研究生。我按 产品工程师 + 开发者 这两头给自己定位:一头负责把业务上的「对」定义清楚,一头负责把它跑出来。
看多了会发现,Agent 落地这件事长的是同一个形状:怎么把一个不确定的模型行为, 变成能被校验、能被维护的工程部件。我的做法是先定什么算对,再定拿什么验证它, 能力这件事排第三位。
另一头我做过模型。癫痫异常放电检测这条线,噪声大、标注贵、错一次代价重, 从时间编码到图注意力再到检测试证客户端,得自己走完整条。 这段经历给我的是底层视角:模型能力之外,系统能不能被验证才是上限。
More about me
Blog
- 拆一个能上生产的 Agent 运行时:依赖方向、循环与压缩 2026-10-08
一个上得了生产的 Agent 运行时把代码切成调模型、跑循环、做业务几层。值得抄的不是它暴露了多少 API,而是循环靠什么停、压缩切在哪、对话存成什么形状这三处取舍。
- 横向验收任何一个 AI 产品:一张八层检查表 2026-09-30
判断一个 Agent 能不能上线,不该看它演示得多聪明。把产品拆成任务、上下文、能力、编排、执行、验证、状态、信任八层逐项问过去,任一层答不上来,就是那个洞。
- 让 Agent 给自己打分,评测集就开始变成作弊集 2026-09-17
自进化闭环一旦转起来,分数的含义就变了:题变窄、判据泄漏、模型给自己答案打高分,都能让曲线向上而能力不动。这篇写怎么给闭环装一根模型碰不到的尺子,也写闸门不装时分数往哪走。
- 先画依赖图,再写评测:你的指标会互相污染 2026-09-08
三个指标同时掉,往往只是一个根因被记了三次。评测体系的顺序错了:先把执行依赖图画出来,再规定每个指标在什么条件下可评,才轮到 Judge 和门禁。
- 自治等级不是模型说了算,是能不能撤销说了算 2026-09-01
给 Agent 多少自由度,判断依据不是模型看起来多聪明,而是动作的确信程度和撤销代价。L2 自治不是配置项,是幂等键、撤销窗口、补偿接口和审计工程出来的。
- 可验证性就是能力边界 2026-08-25
生码只占研发链路 20% 到 30%,口径是需求到上线里写代码这段的耗时占比,继续优化它的边际收益已经很低。Agent 能走多远,取决于你能给它多少真实反馈——构建、测试、部署、日志、监控,缺一样它就只能靠训练分布猜。
- 给上下文定预算:Multi-Agent 的钱到底花在哪 2026-08-18
多 Agent 拆分不天然省钱——并行意味着多份常驻上下文和初始化开销。真正把账单顶上去的是三类东西:常驻上下文、重复打包的历史,以及每次工具调用要付的四份固定开销。
All posts