小模型 × 全阶段教学
以中文为主的资料与数据,从预训练、SFT 延伸至 MoE、LoRA、偏好对齐、工具调用与 Agentic RL。
MINIMIND-3 · DENSE / MOE · APACHE-2.0 CODE
从零训练小模型,两种切入点。
一边展开全阶段算法,一边打磨训练效率与缩放实验。
点击节点探索源码 · 按维度筛选对比 · 按目标选择学习路线
小模型 × 全阶段教学
以中文为主的资料与数据,从预训练、SFT 延伸至 MoE、LoRA、偏好对齐、工具调用与 Agentic RL。
MINIMIND-3 · DENSE / MOE · APACHE-2.0 CODE
端到端基线 × 效率实验
以 depth 驱动规模家族,从 tokenizer 到 CLI 形成闭环;当前重点是 time-to-GPT-2 与算力最优训练。
DEPTH-DRIVEN · DENSE GPT · MIT CODE
从入口到交付,点击任意节点查看作用、配置差异和对应源码。
比较实际路线与接口。架构、预算与任务不同,能力结论需要同条件测试。
| 对照维度 | MiniMind | nanochat |
|---|
没有匹配的对照维度。
每格「源码依据」链接到固定版本。历史 MiniMind2、旧 nanochat d20 / FineWeb / midtrain / WebUI 介绍,与此处现行参考路线分别看待。
调整租卡费率与实验设定,查看纯 GPU 租用估算。人民币与美元分别展示。
1 张卡 × 2.31 小时 × ¥1.30 / 卡·小时
基准来自 README 经验估算:mini 数据、单张 3090、预训练与 SFT 各 1 epoch。多 epoch 按时长线性模拟,实际运行需测量。未计 RL、奖励模型、评测和部署。查看成本表 ↗
参考榜单训练计时与 README 示例费率
8 张卡 × 1.65 小时 × $3.00 / 卡·小时
1.65 h 取 README 2026-03-14 榜单行,仅训练迭代,排除 eval / logging;不代表当前整条 pipeline。$3 / GPU·h 是作者示例假设,非当日报价。查看计时定义 ↗
两边的模型、数据、训练目标与硬件不同。这些金额帮助规划对应实验;计算效率与能力比较需统一模型目标、任务和计时边界。nanochat README 的 $48 来自 8×H100 × 2 h × $3 的示例。
基于现行项目内容的学习建议。选一个目标,查看四个可直接打开的源码入口。
以官方 README 和源码交叉核验;配置冲突时优先对应训练脚本。链接固定到本次查验的 commit。
master @ f659b55761b7
本次快照提交:2026-09-23(Asia/Singapore)
master @ 92d63d4e8bb4
本次快照提交:2026-07-04(Asia/Singapore)
未发现两个项目在相同数据、模型预算和评测配置下的官方直接对比。此图比较实现与路线,不据不同榜单得分推导胜负。
MiniMind 顶部“2 小时 / 3 元”说明与详细成本表有不同口径;本页采用成本表的阶段估算。nanochat 榜单计时、端到端时长和历史宣传分别读取。
代码协议分别为 Apache-2.0 与 MIT;训练数据、权重及外部组件有各自协议。多模态或实验分支能力单独验证;来源可读不等于所有阶段权重均已发布。