AI实战07|一堆扫描PDF怎么处理?让Agent先识别,再整理,再提取
实际工作里的PDF,并不都是干净的电子文件。
经常会遇到:
扫描合同;
盖章版协议;
证照扫描件;
法院材料;
发票;
截图;
图片版公告。
这些文件打开以后看得见,但文字可能根本无法直接复制。
以前处理这类材料,通常需要人工:
一页一页看;
手动录入;
再整理成表格。
现在如果Agent具备图片和PDF识别能力,可以把这一整套工作先交给它做第一轮处理。
一、先判断是不是扫描件
电子PDF和扫描PDF虽然都叫PDF,但处理方式不一样。
电子PDF通常本身就有文字层。
Agent可以直接:
搜索;
复制;
提取;
定位。
扫描PDF本质上更像:
很多张图片装进一个PDF。
这时候AI需要先“看懂图片”,再提取内容。
所以遇到一批PDF时,可以先让Agent判断:
哪些是正常文本PDF;
哪些是扫描件;
哪些页面识别质量比较差。
不要默认所有PDF都一样。
二、扫描件最适合先做“结构化提取”
比如有50份营业执照。
人工真正需要的通常不是:
把整张营业执照重新转成文字。
而是几个字段:
公司名称;
统一社会信用代码;
法定代表人;
注册资本;
成立日期;
住所。
所以扫描件处理最实用的方法是:
不要先追求全文OCR,而是先明确你到底要提取什么。
字段越明确,Agent越容易得到可用结果。
三、合同扫描件可以先提取关键信息
比如几十份盖章合同。
可以先批量提取:
合同名称;
签约主体;
签署日期;
金额;
期限;
盖章情况。
再把结果形成Excel。
如果后面发现某几份合同有风险,再进一步读取全文。
没必要一开始把几千页扫描件全部转成完整文字。
这样速度和准确性通常都会更好。
四、图片质量会直接影响结果
扫描件最常见的问题包括:
倾斜;
模糊;
阴影;
印章遮挡;
页面缺角;
分辨率太低;
手写内容;
复印件反复复印。
所以不要要求AI:
“必须识别出来。”
识别不清楚时,更可靠的处理方式应该是:
标记:
“无法确认”。
特别是:
金额;
日期;
身份证号;
统一社会信用代码;
合同编号
这类字段,不能靠猜。
五、重要字段最好保留“原始页码”
比如AI告诉你:
合同金额是500万元。
你最好还能知道:
这个数字来自第几页。
这样人工复核时可以直接跳到对应位置。
所以专业材料整理时,我通常建议同时保留:
文件名;
页码;
提取结果。
如果条件允许,还可以保存对应原文片段。
这样结构化结果才真正可以复核。
六、扫描材料特别适合做“资料盘点”
比如一个尽调文件夹里有200份扫描材料。
第一轮根本不需要逐份深度分析。
可以先让Agent回答:
有什么材料;
分别属于什么类别;
关键日期是什么;
哪些文件重复;
哪些文件明显缺页;
哪些材料看不清。
最终得到一张:
资料清单。
这一步完成以后,人再决定哪些材料需要重点审查。
这比一开始就让AI:
“全面分析200份文件”
实际得多。
七、证据材料也可以先做初步目录
比如一批:
合同;
转账记录;
聊天截图;
发票;
通知;
照片。
可以先让Agent按照文件内容形成:
文件名称;
日期;
涉及主体;
材料类型;
主要内容;
可能证明的事项。
形成一份初步证据目录。
之后律师再进行:
取舍;
调整顺序;
确认真实性;
确定最终证明目的。
AI负责第一轮整理,人负责最终判断。
八、不要让识别结果直接替代原件
这一点很重要。
不管AI识别得多准确:
提取结果始终只是加工结果。
真正需要确认的重要事实,仍然应该回到:
原始PDF;
原始图片;
原始证据材料。
尤其是涉及:
金额;
签字;
盖章;
日期;
主体身份;
关键条款。
所以Agent的价值主要是:
帮助人快速定位和整理,而不是让原始文件失去意义。
直接复制的实战提示词
请处理【扫描PDF/图片文件夹路径】中的全部材料。先识别文件类型和可读情况,再按统一字段提取【公司名称、日期、金额、主体、合同编号等需要的字段】,同时保留原始文件名和对应页码;无法清晰识别的内容标记“待人工核对”,不得猜测。最终生成【资料清单.xlsx/证据目录.xlsx】,并单独列出无法读取、疑似缺页或需要人工核验的文件,保存至【输出文件夹】,不得修改原始材料。
最后记住一句话
处理扫描材料时,不要一上来就要求AI:
“把所有内容全部识别出来。”
先问:
“我真正需要从这些材料里提取什么?”
字段定义清楚以后,
大量原本需要人工逐页翻看的扫描材料,就可以先让Agent完成第一轮整理。
