AI入门30|最终篇:从大模型到Agent,把今天的AI世界重新拼起来
这是《AI入门:从大模型到智能体》的最后一篇。
前面用了很多篇文章,分别讲了:
大模型;
Token;
上下文;
Prompt;
多模态;
Agent;
Harness;
工具;
MCP;
知识库;
记忆;
Skill;
Subagent;
Multi-Agent;
Embedding;
RAG;
微调;
API;
本地模型和云端模型。
单独看,每一个词都不算特别复杂。
真正难的是:
它们到底是什么关系?
所以最后一篇,不再增加新概念。
我们把整个AI世界重新拼一次。
一、最底层先是“模型”
今天很多生成式AI能力,核心来自大模型。
它通过大量训练获得:
语言理解;
生成;
推理;
代码;
多模态等能力。
可以把模型理解成整个系统最核心的“智能来源”。
但模型本身不等于ChatGPT,也不等于Agent。
二、模型工作离不开Token和上下文
文字进入模型以后,会被转换成Token处理。
而模型一次能够处理多少信息,受到上下文窗口影响。
所以模型并不是天然看到你的:
全部聊天;
整个硬盘;
全部知识库;
整个互联网。
它只能使用当前任务真正进入上下文的信息。
这也是为什么“给AI什么信息”如此重要。
三、Prompt负责告诉AI当前要做什么
Prompt并不是神秘咒语。
本质上就是:
任务说明。
你告诉AI目标、材料、重点、限制和输出。
但Prompt只是上下文的一部分。
一个好结果还依赖:
正确资料;
工具;
模型能力;
整个Agent运行方式。
四、大模型进一步进入Agent
如果AI只能:
你问一句,它答一句,
它主要还是聊天助手。
如果它可以:
自己读取文件;
调用工具;
搜索资料;
运行代码;
持续执行多个步骤;
生成并保存成果,
它就越来越接近:
Agent,智能体。
所以可以用一个非常简化的理解:
大模型提供智能,Agent把智能变成任务执行。
五、Harness负责把Agent组织起来
一个Agent为什么知道:
什么时候调用工具;
工具返回后下一步做什么;
失败以后是否重试;
上下文太长以后怎么处理?
这背后往往就涉及:
Harness。
它负责围绕模型组织Agent Loop、工具、上下文和运行规则。
这也是为什么同一个模型放在不同Agent里,实际表现可能差很多。
六、工具让Agent接触真实世界
模型自己不会天然知道:
今天的新闻;
你邮箱里的邮件;
电脑里的文件;
数据库里的最新数据。
所以Agent需要工具。
搜索、文件系统、浏览器、数据库、终端、代码执行,都可以成为工具。
模型负责判断,工具负责真正执行动作。
七、MCP和连接器负责“把外部能力接进来”
工具越来越多以后,就需要更标准的连接方式。
MCP就是其中非常重要的一套开放协议。
一些产品会把外部集成功能叫“连接器”。
连接器背后可能使用MCP,也可能使用官方API或产品自己的集成方式。
普通用户最重要的是理解:
这些能力都在帮助Agent连接外部系统。
八、API让模型和服务进入各种软件
为什么同一个大模型可以出现在很多不同产品里?
因为开发者可以通过API调用模型能力。
所以今天AI早就不只是几个聊天网站。
它可以进入:
办公软件;
代码工具;
企业系统;
Agent;
各种自动化程序。
API是这个生态非常基础的一层。
九、知识库、Embedding和RAG负责“找资料”
如果资料很多,就不能全部塞进上下文。
于是需要知识库。
Embedding帮助系统按照语义相似度找到相关内容。
RAG则进一步把整个过程组织成:
先检索;
再把资料放进上下文;
最后让模型生成答案。
所以专业AI的可靠性,很大一部分来自:
模型不是只靠记忆回答,而是在需要时先查资料。
十、记忆负责保存长期有价值的信息
知识库存大量资料。
记忆则更适合保存:
用户偏好;
长期背景;
项目状态;
重要决定。
它让AI不必每次重新认识你。
所以:
知识库更像资料室。
记忆更像长期合作过程中留下的工作信息。
十一、Skill让Agent不必每次重新学方法
Prompt告诉AI:
这次做什么。
Skill告诉Agent:
这一类事情通常怎么做。
于是合同审查、案例检索、会议纪要、代码检查等重复工作,可以逐渐形成可复用的方法。
Agent开始从:
“什么都要重新教”
变成:
“已经会一些固定工作”。
十二、复杂任务还可以进一步拆给Subagent
一个主Agent内部,可以把不同子任务交给多个Subagent。
它们分别研究、处理、复核,再把结果交回主Agent。
这是:
一个Agent内部的任务分工。
如果是多个相对独立的Agent之间协作,则属于:
Multi-Agent。
两者不能混为一谈。
十三、模型还可以通过微调进一步改变行为
如果只是需要最新资料,通常可以用RAG。
如果希望模型本身在某类任务上的行为更加稳定,则可能考虑Fine-tuning。
所以:
RAG改变模型拿到的信息。
微调改变模型本身。
这是两个完全不同的方向。
十四、这些模型可以运行在云端,也可以运行在本地
云端模型通常使用方便、能力强,不需要自己维护硬件。
本地模型则强调控制、隐私、离线和私有化部署。
而“开源”或“开放权重”讲的是模型开放程度,不等于一定在本地运行。
所以今天的AI并不是只有一种形态。
它可以部署在不同环境,再和不同工具、知识库和Agent组合。
十五、把整套关系压缩成一张文字地图
可以这样理解:
AI
↓
大模型:提供智能
↓
Token / Context / Prompt / Multimodal:模型如何接收和处理信息
↓
Agent:让模型开始完成任务
↓
Harness:组织Agent怎么持续运行
↓
Tools:让Agent真正执行动作
↓
MCP / Connectors / API:连接外部系统和服务
↓
Knowledge Base / Embedding / RAG:让Agent找到需要的资料
↓
Memory:保存长期信息
↓
Skill:复用工作方法
↓
Subagent / Multi-Agent:进一步分工与协作
这就是今天一个现代AI工作系统的大致轮廓。
十六、AI入门真正需要学会的,不是背名词
理解这些概念以后,你不一定需要:
自己训练模型;
自己写MCP;
自己部署向量数据库;
自己开发Agent Harness。
但以后再看到一个AI产品,你应该能够判断:
它用的是什么模型?
它只是聊天,还是Agent?
它有哪些工具?
能不能连接外部系统?
有没有知识库和RAG?
有没有记忆和Skill?
能不能调用Subagent?
这些问题比单纯问:
“这个AI聪不聪明?”
更接近真实的AI能力。
十七、这个系列到这里结束
《AI入门:从大模型到智能体》解决的是:
这些东西到底是什么。
但理解概念以后,下一个问题才真正开始:
我们应该怎样选择模型?
怎样组织Agent?
怎样设计Skill?
怎样搭知识库?
怎样管理项目文件?
怎样安排多个Agent协作?
怎样让AI真正进入每天的工作?
这些就不再只是“AI入门”。
它进入的是另一个主题:
如何建立自己的AI工作系统。
这也是《AI优先:建立自己的AI工作系统》要解决的问题。
所以两个系列可以用一句话连接:
《AI入门》告诉你今天的AI世界由什么组成;《AI优先》告诉你怎么把这些东西真正组织起来,为自己工作。
