AI优先|给AI设验收标准:不要只说“做完”,要定义什么叫“做好”
很多AI任务最后效果不好,不一定是模型能力不够。
还有一种很常见的原因:
任务虽然交出去了,但没有提前定义“做到什么程度才算完成”。
比如你让AI:
“帮我审一下这份合同。”
它确实审了。
但你真正想要的可能是:
- 代表客户立场;
- 只做最小必要修改;
- 不能擅自改商业条款;
- 法律依据要核验现行有效;
- 要输出修改版Word;
- 还要列出风险说明和人工确认事项。
如果这些要求一开始没有说清楚,最后再去评价AI“做得不好”,其实有一部分问题出在任务设计。
所以我现在越来越重视一件事:
在AI开始工作之前,先定义验收标准。
一、不要只告诉AI“做什么”,还要告诉它“什么叫完成”
一个完整任务,至少应该回答两个问题:
第一:
要做什么?
第二:
做到什么程度才算合格?
比如:
“整理这批IPO问询案例。”
只是任务。
如果再加上:
- 公司名称不能遗漏;
- 板块要准确;
- 问询要点要归纳;
- 回复口径要总结;
- 每个结论都要能够回到原始材料;
- 最终输出Excel;
- 无法确认的信息单独标记。
这才开始接近验收标准。
有了标准以后,AI才知道终点在哪里。
二、验收标准最好在任务开始前写清楚
很多人习惯AI做完以后再说:
“这个还不够。”
“再详细一点。”
“这个格式不对。”
“怎么没有出处?”
这样当然也能改。
但效率很低。
因为本来可以第一次就完成的工作,变成了反复返工。
所以我现在更喜欢:
把复核标准提前变成执行标准。
例如最终我一定会检查:
- 有没有漏掉关键风险;
- 法律依据是不是最新;
- 有没有误改商业条款;
- 输出文件是否完整。
那这些要求就应该一开始告诉AI。
这样AI在执行过程中就可以自己检查一次。
三、法律工作尤其需要明确验收标准
法律工作最怕一种情况:
文章写得很好看,但不能用。
所以法律任务不能只看:
- 语言是否流畅;
- 结构是否完整。
还要看:
- 结论有没有依据;
- 引用是否真实;
- 法规是否现行有效;
- 有没有混淆合同事实和法律判断;
- 有没有遗漏对客户不利的内容;
- 修改有没有超过授权范围。
例如审一份合同,我可能会把完成标准简单定义成:
- 原文件不覆盖;
- 保留原结构和编号;
- 仅做必要修改;
- 重大风险不得遗漏;
- 法律依据需要核验;
- 输出修改稿和修改说明;
- 不确定事项单独列明。
AI满足这些条件以后,才算真正完成。
四、输出格式本身也是验收标准
有时候AI分析其实没问题,但最后还是不好用。
因为它只在聊天框里输出了一大段文字。
而真正工作需要的是:
- Word;
- Excel;
- Markdown;
- PDF;
- 风险清单;
- 修改说明表。
所以:
输出什么,本身就是任务的一部分。
如果最后需要Word,就一开始要求生成Word。
如果需要Excel做后续筛选,就直接要求结构化字段。
不要让AI先写一篇文章,最后再人工搬到表格里。
这也是“不要陪AI工作”的一部分。
五、可以让AI在交付前先自检
一个很好用的方法是:
任务最后增加一句:
“完成后按照上述验收标准自行检查,发现问题先修正,再交付。”
这样AI就多了一次自检。
例如它可以检查:
- 文件有没有漏;
- 字段有没有缺;
- 格式是否统一;
- 引用是否存在;
- 是否覆盖了原文件;
- 有没有未解决事项。
当然,这不能代替人工复核。
但可以把很多低级错误挡在前面。
六、复杂任务可以设置阶段验收
如果任务很大,不一定等到最后才验收。
可以设置几个关键节点。
比如:
- 第一阶段,确认资料是否完整;
- 第二阶段,确认分析框架是否合理;
- 第三阶段,确认初步结论是否跑偏;
- 最后再做完整交付。
这样人不需要全程陪着AI。
只在真正影响后续方向的节点介入。
这比每一步都确认,也比完全放任到最后,更合理。
七、最好的验收标准,应该可以重复使用
如果某类工作经常发生,就不要每次重新想验收标准。
比如:
- 合同审查;
- 尽调;
- 法律检索;
- 文件整理;
- IPO问询整理。
都可以形成固定检查清单。
然后直接写进Skill。
这样以后Agent每次执行,都自动按照同一套标准工作。
这时候验收标准就不再只是最后一道检查。
而是变成:
整个AI工作流程的一部分。
八、AI做得好不好,很多时候取决于你有没有把“好”定义清楚
我现在越来越觉得,AI任务设计里最容易被忽略的一句话是:
“什么结果才算合格?”
如果这个问题自己都没有想清楚,
AI当然只能猜。
所以以后交任务之前,我觉得可以固定多问一句:
我最后准备怎么检查它?
把这些检查项提前写进任务。
这样AI就知道:
- 目标是什么;
- 边界在哪里;
- 最终要交什么;
- 什么情况下才算完成。
前面我一直讲:
5%的时间设计,90%的时间让AI执行,5%的时间复核。
其实前面的5%设计得越清楚,
最后的5%复核就越轻松。
因为真正好的AI工作流不是:
AI做完以后,人再想办法挑错。
而是:
在AI开始之前,就已经把“什么叫做好”定义清楚。
