Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/ai-basics-12-multimodal-ai-ABL-20260831-V1.md

AI入门12|什么是多模态AI?为什么它不只会读文字了

今天越来越多AI已经不只是处理文字。

你可以给它:

图片、截图、PDF、语音、视频、表格。

这背后就是:

多模态AI。

一、什么叫“模态”?

可以简单理解成:

信息的不同形式。

文字是一种,图片是一种,声音是一种,视频又是一种。

以前很多AI系统只擅长其中一种。

现在越来越多模型能够同时处理多种形式的信息。

二、最直观的变化:AI开始“看得见”

你不需要把截图里的内容手动打出来。

可以直接问:

“这个页面是什么意思?”

律师工作里,聊天截图、扫描合同、组织架构图、工商截图,都可以直接成为输入。

三、AI也越来越能够“听”

语音不只是转文字。

现代AI还可以结合对话上下文理解你在问什么,再继续回答。

这让会议整理、访谈转录、语音交流、外语练习都更自然。

四、文件处理也可能涉及多模态

一份PDF里可能同时有:

正文、表格、图片、扫描页、图表、版式。

真正好用的AI需要综合理解这些内容,而不是只提取纯文本。

五、多模态不只是“图片转文字”

传统方式常常先OCR,再把文字交给模型。

更先进的多模态模型可以直接理解图像中的布局、图表、对象和文字关系。

所以多模态的价值不是多几个文件格式,而是:

模型可以同时理解不同形式的信息。

六、对普通工作有什么意义?

以前为了让AI处理材料,人要先做大量搬运:

复制PDF、手打截图、转录音频、整理表格。

现在越来越多原始材料可以直接交给AI。

七、但“能看”不等于一定看得对

模糊扫描、复杂表格、裁切截图、手写内容都可能识别错误。

特别是金额、日期、姓名、比例、合同编号等关键字段,仍然需要复核。

八、能给原文件时,尽量给原文件

有Excel就不要只给截图,有完整Word就不要只截局部图片。

原文件通常包含更多结构和信息。

九、这一篇只需要记住一句话

多模态,就是让AI不再只通过文字接触信息,而可以同时处理图片、声音、文件等不同形式的真实材料。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信