跳转到主要内容
全部手记
3 分钟阅读文 / Hll

AI 写完代码之后,如何判断任务真的完成了

从 Coductor 的实践出发,让目标、测试、浏览器结果和交付证据形成可以检查的对应关系。

工程实践AI 工作流

一个研发任务的终点,不应该只是一段「已经完成」的描述。代码能够编译、测试全部通过、页面看起来正常,分别证明了不同的事情。要判断用户目标是否达成,还需要知道这些检查和最初的要求有什么关系。

把目标变成可检查的条件

以一个搜索功能为例,验收至少包含:输入关键词能返回正确内容;没有结果时有明确反馈;键盘可以完成操作;移动端不会出现遮挡。只验证搜索函数,无法替代对整个流程的检查。

证据可以有多种形态

Coductor 将目标、规格、验证计划和结果保存为结构化产物。命令执行结果、浏览器检查、截图和输出文件都可以成为证据,每一种证据都需要对应到具体的验收条件。

  • 单元测试验证局部逻辑和边界输入。
  • 浏览器检查验证页面和交互流程。
  • 截图用于检查布局、可读性与状态呈现。
  • 运行产物记录实际输出,而不是只保留执行过程。

修复循环也要有边界

失败后自动修复有价值,但无止境的重试可能只是在重复同一个错误。记录失败原因、区分新问题与重复问题,并设置修复次数边界,才能让流程在无法自动推进时给出清晰的下一步。

让结论能够被回看

交付证据的价值,是让后来的人理解这次工作做了什么、检查了什么,以及哪些部分仍有不确定性。可追溯的完成状态,比更长的完成报告有用。