AI 写完代码之后,如何判断任务真的完成了
从 Coductor 的实践出发,让目标、测试、浏览器结果和交付证据形成可以检查的对应关系。
一个研发任务的终点,不应该只是一段「已经完成」的描述。代码能够编译、测试全部通过、页面看起来正常,分别证明了不同的事情。要判断用户目标是否达成,还需要知道这些检查和最初的要求有什么关系。
把目标变成可检查的条件
以一个搜索功能为例,验收至少包含:输入关键词能返回正确内容;没有结果时有明确反馈;键盘可以完成操作;移动端不会出现遮挡。只验证搜索函数,无法替代对整个流程的检查。
证据可以有多种形态
Coductor 将目标、规格、验证计划和结果保存为结构化产物。命令执行结果、浏览器检查、截图和输出文件都可以成为证据,每一种证据都需要对应到具体的验收条件。
- 单元测试验证局部逻辑和边界输入。
- 浏览器检查验证页面和交互流程。
- 截图用于检查布局、可读性与状态呈现。
- 运行产物记录实际输出,而不是只保留执行过程。
修复循环也要有边界
失败后自动修复有价值,但无止境的重试可能只是在重复同一个错误。记录失败原因、区分新问题与重复问题,并设置修复次数边界,才能让流程在无法自动推进时给出清晰的下一步。
让结论能够被回看
交付证据的价值,是让后来的人理解这次工作做了什么、检查了什么,以及哪些部分仍有不确定性。可追溯的完成状态,比更长的完成报告有用。