FROM OPEN WEIGHTS TO YOUR MODEL

开源模型微调全景↗

从一个已有模型出发,把领域数据、任务目标和算力预算,
变成可验证、可部署的专属能力。

FIELD NOTES / 012026.10.03

先定义能力缺口,
再决定怎么训练。

已有权重+高质量反馈→任务适配

以 LLM 为主线 · 延伸至视觉、语音与检索
“开源”含开放权重示例;许可需逐模型确认。

01 / THE BIG PICTURE

一张图,看清完整路径

点击节点,展开实施要点
选择你的目标
从基座到生产 / 9 个环节
当前路线按需启用
评估贯穿全过程失败样本 → 数据修订 → 重新训练 → 回归验证

按横排从左向右阅读。中间训练环节可跳过或替换;点击灰色节点仍可查阅。

一定要微调吗?

知识经常更新 → 先考虑 RAG;规则少、示例少 → 先试 Prompt / Few-shot;输出方式需要稳定改变 → 再评估微调。三者可以组合。

02 / CHOOSE THE STARTING POINT

选基座,先看适配条件

模型卡比排行榜更接近你的部署现实。

起点 A

Base / 预训练模型

适合需要较深领域适配、有充足语料和训练经验的团队。通常还需 SFT 才能稳定遵循指令。

更大的训练自由度 · 更完整的后训练责任
01

能力与架构

语言、代码、多模态;Dense / MoE;总参数与激活参数分开看。

02

训练与推理预算

最长序列、峰值显存、吞吐与延迟;先用目标环境做小样本试跑。

03

兼容性

Tokenizer、Chat template、量化格式、训练框架和推理引擎逐项匹配。

04

许可证与版本

核对具体 checkpoint 的微调、商用及分发条款;固定模型 revision。

代表性起点
示例,非排名
不只语言模型:四条迁移分支

视觉语言 VLM

图片+对话 / 文档标注。决定冻结视觉编码器、只调投影层或调整语言模型;评估 OCR、定位和幻觉。

TRL 多模态 SFT ↗

图像生成 / 扩散

图像+描述,用 LoRA / DreamBooth 学习主体或风格;不照搬 LLM 的 next-token 损失和数据格式。

Diffusers 训练指南 ↗

语音 / ASR

音频+转写文本,校准采样率、语言和时间对齐;按说话人或场景切分,用 WER / CER 评估。

Transformers ASR ↗

Embedding / Reranker

Query+相关文档+难负例,用对比学习或排序目标;看 Recall@k、MRR、nDCG 和业务召回。

Sentence Transformers ↗
03 / TWO INDEPENDENT AXES

微调方法,分成两个维度

SFT + QLoRA 是一种组合,
不是两个互斥的选择。

A

学什么?

训练目标

CPT / DAPT

领域分布

在领域语料上继续语言建模,适应术语、表达和文本分布。

原始文本 → 预测下一个 token
SFT

任务示范

从高质量答案中学习指令、格式、流程和工具调用方式。

输入+参考输出 → 监督学习
DPO

偏好选择

从同一提示下的优劣回答对中,学习更符合偏好的输出。

chosen / rejected → 离线偏好
GRPO / PPO

奖励驱动

生成回答、获得奖励、更新策略;需可靠的奖励设计与评估。

prompt+奖励机制 → 在线采样
B

改哪里?

参数更新方式

补充方法

Adapter、Prefix / Prompt tuning 是其他参数高效方法;DoRA 是 LoRA 的扩展。蒸馏用于能力迁移,量化用于降低数值精度,均不能直接等同于 SFT。

PEFT 文档 ↗
RESOURCE LENS

权重占用,只是起点

3.50GB理想权重存储

7 × 10⁹ × 4 ÷ 8 ÷ 10⁹ = 3.50 GB

权重梯度优化器状态激活 / 工作区

GB 采用十进制;未含量化元数据、适配器、激活、优化器及碎片。此数值不是训练所需显存,也不代表某张卡可以跑。MoE 存储看总参数,不只看激活参数。

PARAMETER LENS

LoRA,到底少改了多少?

W冻结 4096 × 4096
+
BA仅训练低秩增量
=
W′适配后的映射

0.78%该矩阵新增可训练参数比例
131,072 ÷ 16,777,216

单矩阵示意:r × (dᵢₙ + dₒᵤₜ)。省略缩放系数 α/r;整模型比例取决于目标模块和层数。提高秩不保证效果更好。

04 / DATA IS THE CURRICULUM

数据决定模型学到什么

先留出测试集,再围绕真实失败样本改进。

01 / 真实任务覆盖

按任务、难度、语言与长尾场景分层。包含拒答、边界、工具失败与恢复样本。

02 / 清洗与去泄漏

授权、脱敏、去重。按文档、用户、时间或实体划分数据集,避免近重复样本跨集合。

03 / 模板与标签检查

训练前打印 token 化样本。核对角色标记、EOS、截断和 loss mask;推理使用匹配模板。

04 / 质量胜过盲目堆量

人工抽样+规则校验,保留困难负例。合成样本也要复核,不能用测试答案反向造训练数据。

检查一次 loss 的“视野”system / user:可屏蔽assistant:目标 token

SFT 可只对回复计损失,也可对完整序列计损失;取决于训练目标与框架配置。必须检查实际标签。

05 / MAKE IT WORK

从小实验,到可靠交付

先证明业务增益,再扩大训练规模。

01

单卡 / 小团队

较小 Instruct → QLoRA / LoRA SFT

  • 先跑通几十条样本,核对标签与生成。
  • 从短序列、小 micro-batch 起步;必要时梯度累积、梯度检查点。
  • 显存仍不足就降规模或长度;别把累积步数当作单样本省显存手段。
交付:adapter+基座 revision+评估报告
02

领域深度适配

领域语料 → 可选 CPT → SFT → 评估

  • 先证实领域分布缺口,再投入继续预训练。
  • 用通用数据回放等策略控制遗忘。
  • 按预算选择 LoRA 或全参;大模型考虑 FSDP / ZeRO 分片。
交付:领域 checkpoint+通用能力回归
03

偏好 / 可验证推理

合格基线 → DPO 或奖励驱动训练

  • 有可靠偏好对:先评估 DPO。
  • 有稳定奖励与采样预算:再考虑 GRPO / PPO。
  • 监测奖励投机、答案变长与分布外退化。
交付:盲测增益+奖励审计+成本报告

一次训练的验收清单

0 / 8
勾选仅作为本地备忘,不代表已完成真实训练或评估。
MEASURE THE CHANGE

用同一把尺子比较

原始基座vs.微调模型
任务效果

抽取 F1、格式合规率、工具成功率、业务通过率,按场景分组统计。

能力保留

通用问答、域外任务、拒答边界、多语言与长上下文回归。

线上成本

TTFT、每秒 token、峰值显存、并发和单位成功任务成本。

比较条件

固定测试集、模板与采样参数;人工盲评结合自动评测,量化 / 合并后重新验收。

训练 loss 下降 ≠ 业务效果提高。
保留原模型、版本清单和回滚入口。

常见故障 → 优先排查

训练一开始就 OOM

先查最长样本和 micro-batch;缩短长度、启用梯度检查点、减少目标模块,再考虑量化基座或分片。

会背训练集,线上不行

查泄漏、样本重复、任务覆盖和验证集;降低训练强度,重新检查模板与评估分布。

训练稳定,输出乱码

核对 tokenizer / chat template / EOS,以及基座与 adapter revision;先用未量化权重复现。

奖励提高,答案更差

审查奖励函数和长度偏置,用独立验证器与人工盲评复查;奖励不能作为唯一验收指标。

06 / THE TOOLCHAIN

把工具放回各自的位置

按层组合;无需为了微调装齐所有工具。

最终交付物权重 / Adapter模型与数据版本Tokenizer / 模板训练配置评估报告服务与回滚配置
07 / KEEP EXPLORING

原始资料与阅读入口

以论文、官方文档与模型卡为依据。

这是方法全景与实施参考,不是实时模型排行榜。模型与工具为代表性示例;安装参数、支持矩阵和许可,以对应版本的官方文档为准。页面中的计算与数据均已标注假设。

适配 / ADAPT ↑

已有能力,是起点。可验证的增益,才是微调的终点。

中文交互图谱 · 单文件 HTML