SOFT TARGETS / 软目标
温度改变了什么?
固定同一前缀下的 4 个候选 token。调高温度,让低概率候选的相对信息变得更明显。
0.5 · 更尖锐5.0 · 更平滑
0 · 仅硬标签1 · 仅软目标
L = (1 − α) CE(y, pS1)
+ ατ² KL(pTτ ‖ pSτ)
+ ατ² KL(pTτ ‖ pSτ)
—硬标签 CE · nats
—τ² × KL · nats
—加权总损失
把教师的能力,转化为学生的学习信号。沿着六个维度,理解方法、取舍与落地闭环。
没有找到匹配概念。试试“KL”“LoRA”或“推理”。
| 知识载体 / 方法 | 教师要求 | 学生学习目标 | 适用场景 | 主要取舍 |
|---|
固定同一前缀下的 4 个候选 token。调高温度,让低概率候选的相对信息变得更明显。
教师 logits = [4, 2, 1, 0],学生 logits = [2, 2.5, 1, 0.5]。硬标签为“蓝色”。
pᵢ = exp(zᵢ / τ) / Σⱼ exp(zⱼ / τ)。使用自然对数;τ² 是经典温度补偿,具体实现可不同。
覆盖真实输入、难度与语言;先隔离测试集。
记录版本、提示、采样配置和授权范围。
规则、测试、验证器和抽样人工复核。
兼顾领域覆盖、通用能力和可学习难度。
基于开发集失败补数据,保留盲测集。
用 8 条虚构样本演示过滤。同一条样本可以同时命中多个规则。
保留比例只描述这组教学样本,不代表真实数据通过率。
规则变化会即时更新
得到一条可验证的起步路线,不把选型规则当作性能保证。
勾选已准备好的验证项。完成清单表示评测准备情况,不代表模型已通过验收。
代表性工作 · 非穷尽目录
按首次公开年份展示。页面是教学综述,不是模型榜单;所列方法适用不同任务和模型。参考资料核对于 2026-10-03。