Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/ai-basics-06-how-llm-is-trained-ABL-20260831-V1.md

AI入门06|一个大模型,到底是怎么训练出来的?

前面讲过,大模型会通过预测下一个Token学习语言。

但一个今天可以正常聊天、推理和调用工具的大模型,并不是只做一次训练就结束。

可以把整个过程简单理解成几个阶段。

一、第一步:准备训练数据

训练数据可能来自:

网页、书籍、论文、代码、公开资料以及其他依法取得和处理的数据。

在真正训练之前,还需要进行大量:

清洗、去重、过滤和格式处理。

数据质量会直接影响模型质量。

二、第二步:预训练

Pre-training,预训练,是大模型形成通用能力的核心阶段。

模型不断看到大量文本,并尝试预测后续Token。

预测错误以后,训练算法调整内部参数。

这个过程重复极其庞大的次数。

最终,大量语言和知识模式被编码进模型参数。

三、模型不是把训练材料原样存进数据库

这是一个非常重要的区别。

训练完成后,模型主要保留下来的是大量参数和权重。

它不像一个硬盘:

“这里保存着第1本书、第2份合同、第3篇论文。”

因此大模型拥有广泛知识,并不意味着它是一个可以精确查询原文的数据库。

这也是为什么它可能知道一个法律原则,却把具体法条说错。

四、第三步:指令训练

只完成预训练的模型,更像一个很会继续写文字的“基础模型”。

但普通用户希望它能够:

回答问题、服从要求、总结文件、按照格式输出。

所以还需要进一步做指令训练,让它学会:

面对一个任务应该怎样响应。

五、第四步:人类反馈和对齐

模型还会通过人类反馈等方式继续调整。

例如比较不同回答:

哪个更有帮助;

哪个更符合要求;

哪个更安全。

你经常会看到RLHF等术语。

入门阶段不需要记住算法细节,只需要理解:

模型会在预训练之后继续被教成一个更适合与人协作的助手。

六、第五步:强化推理、代码、工具和多模态能力

现代模型还可能接受针对性的进一步训练,使它更擅长:

数学;

代码;

复杂推理;

图片和语音;

工具调用。

所以不同模型即使规模接近,能力特点也可能明显不同。

七、训练模型和建立知识库完全不同

如果你把1000份法律文件上传到知识库,通常并没有重新训练模型。

知识库只是让AI回答时可以去检索这些资料。

而训练是改变模型参数本身。

这是两个完全不同的概念。

八、每天聊天也通常不等于重新训练模型

AI产品可能通过:

聊天历史、记忆、项目上下文

让后续体验更连续。

但这不意味着每聊一次,背后的基础大模型就因为你而重新训练一次。

所以后面要逐渐区分:

训练、上下文、知识库、记忆。

九、可以用“培养新员工”做一个比喻

预训练像接受非常广泛的基础教育。

指令训练像学习怎么听懂工作要求。

后续对齐像学习组织的行为规范。

专业训练则像加强某些专项能力。

当然这只是方便理解的比喻。

十、这一篇只需要记住一句话

一个现代大模型通常经历大规模预训练,再通过指令、反馈、推理和工具等训练逐渐成为我们今天使用的AI助手;它学到的是模型参数中的模式,而不是建立了一个精确的原文数据库。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信