跳到主要内容
THE MAKING OF A LANGUAGE MODEL

大模型,是怎样炼成的?

从一段原始文本,到一个能理解、对话和推理的模型。
沿着训练与上线的路线,探索它如何成为稳定的生产服务。

10个关键阶段

搭建知识底座 → 学会遵循指令
模型部署 → 生产优化与迭代

MODEL LIFECYCLE / 点击任意节点探索虚线节点为可选阶段 · 评估贯穿全程
01 / FOUNDATION训练准备

数据准备Data preparation

让模型学到什么,首先取决于你让它看到什么。

01 / 10

从能力,到稳定的服务。

THE BIG PICTURE

训练时,不同阶段的“学习信号”改变模型行为;部署和生产优化则让能力稳定地服务于真实用户。

预训练

用文本本身提供答案,学习下一个 Token 的概率。

监督微调

模仿高质量示范,学习怎样遵循指令完成任务。

偏好与奖励

比较回答的好坏,或验证任务结果,调整生成策略。

部署与优化

把权重变成服务,再用监控与压测改善容量、延迟、成本和稳定性。

几个常见的误解

GOOD TO KNOW
这 10 个阶段都属于模型训练吗?

不是。前半程描述训练,后半程包括评估、服务部署和生产优化。继续预训练与推理强化学习可选;偏好对齐有不同路线。上线配置通常不更新模型权重,实际流程也可能多轮迭代。

SFT、LoRA 和 RAG 是同一类东西吗?

SFT 是利用示范数据进行监督微调的训练方式;LoRA 是减少需要训练的参数量的一种技术,可用于微调;RAG 是推理时检索资料再回答,通常不更新模型权重。

训练 Loss 越低,模型就越好用吗?

训练 Loss 只描述拟合训练目标的程度。还需要在独立数据上验证泛化、指令遵循、事实准确性和安全性。数据泄漏、过拟合和奖励投机都可能让指标看起来很好。

模型上线之后,还会自动学习吗?

普通推理只读取模型参数,不会因为一次对话自动更新权重。收集反馈、筛选数据、重新训练和验证,是后续版本迭代的独立流程。

一眼看懂训练与上线

从通用能力到任务行为:数据 → 表征 → 预训练 → 后训练 → 评估 → 部署 → 生产优化。
下列顺序是一条教学路线,可选阶段和方法分支应按目标选用。

↺ 评估贯穿所有训练阶段;上线后通过质量与服务指标改进配置,再通过数据反馈形成下一轮训练。