Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/ai-acceptance-criteria-ABL-20260831-V1.md

AI优先|给AI设验收标准:不要只说“做完”,要定义什么叫“做好”

很多AI任务最后效果不好,不一定是模型能力不够。

还有一种很常见的原因:

任务虽然交出去了,但没有提前定义“做到什么程度才算完成”。

比如你让AI:

“帮我审一下这份合同。”

它确实审了。

但你真正想要的可能是:

  • 代表客户立场;
  • 只做最小必要修改;
  • 不能擅自改商业条款;
  • 法律依据要核验现行有效;
  • 要输出修改版Word;
  • 还要列出风险说明和人工确认事项。

如果这些要求一开始没有说清楚,最后再去评价AI“做得不好”,其实有一部分问题出在任务设计。

所以我现在越来越重视一件事:

在AI开始工作之前,先定义验收标准。

一、不要只告诉AI“做什么”,还要告诉它“什么叫完成”

一个完整任务,至少应该回答两个问题:

第一:

要做什么?

第二:

做到什么程度才算合格?

比如:

“整理这批IPO问询案例。”

只是任务。

如果再加上:

  • 公司名称不能遗漏;
  • 板块要准确;
  • 问询要点要归纳;
  • 回复口径要总结;
  • 每个结论都要能够回到原始材料;
  • 最终输出Excel;
  • 无法确认的信息单独标记。

这才开始接近验收标准。

有了标准以后,AI才知道终点在哪里。

二、验收标准最好在任务开始前写清楚

很多人习惯AI做完以后再说:

“这个还不够。”

“再详细一点。”

“这个格式不对。”

“怎么没有出处?”

这样当然也能改。

但效率很低。

因为本来可以第一次就完成的工作,变成了反复返工。

所以我现在更喜欢:

把复核标准提前变成执行标准。

例如最终我一定会检查:

  • 有没有漏掉关键风险;
  • 法律依据是不是最新;
  • 有没有误改商业条款;
  • 输出文件是否完整。

那这些要求就应该一开始告诉AI。

这样AI在执行过程中就可以自己检查一次。

三、法律工作尤其需要明确验收标准

法律工作最怕一种情况:

文章写得很好看,但不能用。

所以法律任务不能只看:

  • 语言是否流畅;
  • 结构是否完整。

还要看:

  • 结论有没有依据;
  • 引用是否真实;
  • 法规是否现行有效;
  • 有没有混淆合同事实和法律判断;
  • 有没有遗漏对客户不利的内容;
  • 修改有没有超过授权范围。

例如审一份合同,我可能会把完成标准简单定义成:

  • 原文件不覆盖;
  • 保留原结构和编号;
  • 仅做必要修改;
  • 重大风险不得遗漏;
  • 法律依据需要核验;
  • 输出修改稿和修改说明;
  • 不确定事项单独列明。

AI满足这些条件以后,才算真正完成。

四、输出格式本身也是验收标准

有时候AI分析其实没问题,但最后还是不好用。

因为它只在聊天框里输出了一大段文字。

而真正工作需要的是:

  • Word;
  • Excel;
  • Markdown;
  • PDF;
  • 风险清单;
  • 修改说明表。

所以:

输出什么,本身就是任务的一部分。

如果最后需要Word,就一开始要求生成Word。

如果需要Excel做后续筛选,就直接要求结构化字段。

不要让AI先写一篇文章,最后再人工搬到表格里。

这也是“不要陪AI工作”的一部分。

五、可以让AI在交付前先自检

一个很好用的方法是:

任务最后增加一句:

“完成后按照上述验收标准自行检查,发现问题先修正,再交付。”

这样AI就多了一次自检。

例如它可以检查:

  • 文件有没有漏;
  • 字段有没有缺;
  • 格式是否统一;
  • 引用是否存在;
  • 是否覆盖了原文件;
  • 有没有未解决事项。

当然,这不能代替人工复核。

但可以把很多低级错误挡在前面。

六、复杂任务可以设置阶段验收

如果任务很大,不一定等到最后才验收。

可以设置几个关键节点。

比如:

  • 第一阶段,确认资料是否完整;
  • 第二阶段,确认分析框架是否合理;
  • 第三阶段,确认初步结论是否跑偏;
  • 最后再做完整交付。

这样人不需要全程陪着AI。

只在真正影响后续方向的节点介入。

这比每一步都确认,也比完全放任到最后,更合理。

七、最好的验收标准,应该可以重复使用

如果某类工作经常发生,就不要每次重新想验收标准。

比如:

  • 合同审查;
  • 尽调;
  • 法律检索;
  • 文件整理;
  • IPO问询整理。

都可以形成固定检查清单。

然后直接写进Skill。

这样以后Agent每次执行,都自动按照同一套标准工作。

这时候验收标准就不再只是最后一道检查。

而是变成:

整个AI工作流程的一部分。

八、AI做得好不好,很多时候取决于你有没有把“好”定义清楚

我现在越来越觉得,AI任务设计里最容易被忽略的一句话是:

“什么结果才算合格?”

如果这个问题自己都没有想清楚,

AI当然只能猜。

所以以后交任务之前,我觉得可以固定多问一句:

我最后准备怎么检查它?

把这些检查项提前写进任务。

这样AI就知道:

  • 目标是什么;
  • 边界在哪里;
  • 最终要交什么;
  • 什么情况下才算完成。

前面我一直讲:

5%的时间设计,90%的时间让AI执行,5%的时间复核。

其实前面的5%设计得越清楚,

最后的5%复核就越轻松。

因为真正好的AI工作流不是:

AI做完以后,人再想办法挑错。

而是:

在AI开始之前,就已经把“什么叫做好”定义清楚。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信