Base / 预训练模型
适合需要较深领域适配、有充足语料和训练经验的团队。通常还需 SFT 才能稳定遵循指令。
从一个已有模型出发,把领域数据、任务目标和算力预算,
变成可验证、可部署的专属能力。
先定义能力缺口,
再决定怎么训练。
以 LLM 为主线 · 延伸至视觉、语音与检索
“开源”含开放权重示例;许可需逐模型确认。
按横排从左向右阅读。中间训练环节可跳过或替换;点击灰色节点仍可查阅。
知识经常更新 → 先考虑 RAG;规则少、示例少 → 先试 Prompt / Few-shot;输出方式需要稳定改变 → 再评估微调。三者可以组合。
模型卡比排行榜更接近你的部署现实。
适合需要较深领域适配、有充足语料和训练经验的团队。通常还需 SFT 才能稳定遵循指令。
适合业务问答、抽取、格式、工具调用等任务的快速起步。保留原聊天模板,检测通用能力是否退化。
语言、代码、多模态;Dense / MoE;总参数与激活参数分开看。
最长序列、峰值显存、吞吐与延迟;先用目标环境做小样本试跑。
Tokenizer、Chat template、量化格式、训练框架和推理引擎逐项匹配。
核对具体 checkpoint 的微调、商用及分发条款;固定模型 revision。
图片+对话 / 文档标注。决定冻结视觉编码器、只调投影层或调整语言模型;评估 OCR、定位和幻觉。
TRL 多模态 SFT ↗图像+描述,用 LoRA / DreamBooth 学习主体或风格;不照搬 LLM 的 next-token 损失和数据格式。
Diffusers 训练指南 ↗音频+转写文本,校准采样率、语言和时间对齐;按说话人或场景切分,用 WER / CER 评估。
Transformers ASR ↗Query+相关文档+难负例,用对比学习或排序目标;看 Recall@k、MRR、nDCG 和业务召回。
Sentence Transformers ↗SFT + QLoRA 是一种组合,
不是两个互斥的选择。
训练目标
在领域语料上继续语言建模,适应术语、表达和文本分布。
原始文本 → 预测下一个 token从高质量答案中学习指令、格式、流程和工具调用方式。
输入+参考输出 → 监督学习从同一提示下的优劣回答对中,学习更符合偏好的输出。
chosen / rejected → 离线偏好生成回答、获得奖励、更新策略;需可靠的奖励设计与评估。
prompt+奖励机制 → 在线采样参数更新方式
Adapter、Prefix / Prompt tuning 是其他参数高效方法;DoRA 是 LoRA 的扩展。蒸馏用于能力迁移,量化用于降低数值精度,均不能直接等同于 SFT。
PEFT 文档 ↗7 × 10⁹ × 4 ÷ 8 ÷ 10⁹ = 3.50 GB
GB 采用十进制;未含量化元数据、适配器、激活、优化器及碎片。此数值不是训练所需显存,也不代表某张卡可以跑。MoE 存储看总参数,不只看激活参数。
0.78%该矩阵新增可训练参数比例
131,072 ÷ 16,777,216
单矩阵示意:r × (dᵢₙ + dₒᵤₜ)。省略缩放系数 α/r;整模型比例取决于目标模块和层数。提高秩不保证效果更好。
先留出测试集,再围绕真实失败样本改进。
按任务、难度、语言与长尾场景分层。包含拒答、边界、工具失败与恢复样本。
授权、脱敏、去重。按文档、用户、时间或实体划分数据集,避免近重复样本跨集合。
训练前打印 token 化样本。核对角色标记、EOS、截断和 loss mask;推理使用匹配模板。
人工抽样+规则校验,保留困难负例。合成样本也要复核,不能用测试答案反向造训练数据。
SFT 可只对回复计损失,也可对完整序列计损失;取决于训练目标与框架配置。必须检查实际标签。
先证明业务增益,再扩大训练规模。
较小 Instruct → QLoRA / LoRA SFT
领域语料 → 可选 CPT → SFT → 评估
合格基线 → DPO 或奖励驱动训练
抽取 F1、格式合规率、工具成功率、业务通过率,按场景分组统计。
通用问答、域外任务、拒答边界、多语言与长上下文回归。
TTFT、每秒 token、峰值显存、并发和单位成功任务成本。
固定测试集、模板与采样参数;人工盲评结合自动评测,量化 / 合并后重新验收。
训练 loss 下降 ≠ 业务效果提高。
保留原模型、版本清单和回滚入口。
先查最长样本和 micro-batch;缩短长度、启用梯度检查点、减少目标模块,再考虑量化基座或分片。
查泄漏、样本重复、任务覆盖和验证集;降低训练强度,重新检查模板与评估分布。
核对 tokenizer / chat template / EOS,以及基座与 adapter revision;先用未量化权重复现。
审查奖励函数和长度偏置,用独立验证器与人工盲评复查;奖励不能作为唯一验收指标。
按层组合;无需为了微调装齐所有工具。
以论文、官方文档与模型卡为依据。
这是方法全景与实施参考,不是实时模型排行榜。模型与工具为代表性示例;安装参数、支持矩阵和许可,以对应版本的官方文档为准。页面中的计算与数据均已标注假设。