从能力,到稳定的服务。
THE BIG PICTURE训练时,不同阶段的“学习信号”改变模型行为;部署和生产优化则让能力稳定地服务于真实用户。
预训练
用文本本身提供答案,学习下一个 Token 的概率。
监督微调
模仿高质量示范,学习怎样遵循指令完成任务。
偏好与奖励
比较回答的好坏,或验证任务结果,调整生成策略。
部署与优化
把权重变成服务,再用监控与压测改善容量、延迟、成本和稳定性。
从一段原始文本,到一个能理解、对话和推理的模型。
沿着训练与上线的路线,探索它如何成为稳定的生产服务。
搭建知识底座 → 学会遵循指令
模型部署 → 生产优化与迭代
让模型学到什么,首先取决于你让它看到什么。
训练时,不同阶段的“学习信号”改变模型行为;部署和生产优化则让能力稳定地服务于真实用户。
用文本本身提供答案,学习下一个 Token 的概率。
模仿高质量示范,学习怎样遵循指令完成任务。
比较回答的好坏,或验证任务结果,调整生成策略。
把权重变成服务,再用监控与压测改善容量、延迟、成本和稳定性。
不是。前半程描述训练,后半程包括评估、服务部署和生产优化。继续预训练与推理强化学习可选;偏好对齐有不同路线。上线配置通常不更新模型权重,实际流程也可能多轮迭代。
SFT 是利用示范数据进行监督微调的训练方式;LoRA 是减少需要训练的参数量的一种技术,可用于微调;RAG 是推理时检索资料再回答,通常不更新模型权重。
训练 Loss 只描述拟合训练目标的程度。还需要在独立数据上验证泛化、指令遵循、事实准确性和安全性。数据泄漏、过拟合和奖励投机都可能让指标看起来很好。
普通推理只读取模型参数,不会因为一次对话自动更新权重。收集反馈、筛选数据、重新训练和验证,是后续版本迭代的独立流程。