AI 学院 · LLM大模型线 · 节点 14 / 14

规模化路线:定你的 Rung 计划,走向持续演化

最后一课:把 14 课串成你自己的路线图——Rung 阶梯、云 GPU 策略、训练谱系、毕业项目。做完你就站在 Lumen 迭代路线的起跑线上。全程约 50 分钟。

状态 手把手 · 收束前置 全课程预计 50 分钟
本课模式:五步走——画你的 Rung 阶梯 → 定云 GPU 策略 → 设计持续演化回路 → 建训练谱系表 → 选毕业项目。做完,课程结束,你的训练生涯开始。

📋 本课你将完成

步骤 1

画你的 Rung 阶梯(10 分钟)

未完成

🎯 这一步的目标:把「越来越强」落实成可执行的阶梯——每次只放大一个维度。

对照模板写你自己的 Rung
▶ 预期输出(点开对照)
Rung 0(Mac,¥0):50–100M 从零预训练,全链路跑通(07 课已做)
Rung 1(租卡,数百元):0.5–1B 从零预训练(几 B token)——「真正训练过」的体验点
Rung 2(Mac/轻量 GPU):Qwen2.5-3B/7B 上 SFT + DPO/GRPO——第一个有用的模型
Rung 3(钱够时):开源近旗舰基座上 continue-pretrain / 后训练
✅ 检查点:你写下了自己的 Rung 0–3,并标出当前所在。
步骤 2

定云 GPU 策略(10 分钟)

未完成

🎯 这一步的目标:训练是脉冲负载——按小时租,用完即退,不自建硬件。

读三条策略
▶ 预期输出(点开对照)
① 训练是脉冲负载:按小时租(AutoDL/RunPod/Vast),用完即退
② 先小跑通再放大:同一份代码先在 1 卡小规模跑 10 分钟验证,再上 8 卡
③ 分开记账:「测试运行」是学费,「正式运行」才是投入
用下方成本计算器对比方案
▶ 预期输出(点开对照)
(见「云 GPU 成本计算器」实验)
✅ 检查点:你能说出三条策略,并用计算器对比过至少两个方案。
步骤 3

设计持续演化回路(10 分钟)

未完成

🎯 这一步的目标:模型不是一次性艺术品,是持续进化的资产(Lumen L2+ 核心主张)。

读演化回路设计
▶ 预期输出(点开对照)
阶段性重训:新数据积累一批 → 混合旧数据(replay buffer 防灾难性遗忘)→ 重训 → 冻结版本评估
不做在线实时改权重:稳定性/成本/可审计性都更好
每次训练 = 一个版本:可追溯、可回滚、可复现
✅ 检查点:你能解释为什么阶段性重训 + replay 优于在线学习。
步骤 4

建训练谱系表(10 分钟)

未完成

🎯 这一步的目标:从现在开始维护一张「你的文明训练史」——对齐 Lumen 核心原则 6。

建表并填第一行
▶ 预期输出(点开对照)
表头:版本 / 数据哈希 / 代码哈希 / 超参 / 评估 / 结论
第一行:填你 07 课的 50M 训练(数据源/步数/loss/采样样例)
习惯:每次训练一行——这张表将来就是 Lumen 的可复现训练谱系
✅ 检查点:你的训练谱系表有第一行记录。
步骤 5

选毕业项目(10 分钟)

未完成

🎯 这一步的目标:把 14 课收束成一个真实交付——与 Lumen 汇合。

二选一(或都做)
▶ 预期输出(点开对照)
A. 火星语料 SFT:火星制度文本写成 SFT 数据(几百条)→ QLoRA 微调 Qwen2.5-3B → Mars 评估集 v1 前后对比 = Lumen L0.2 完整预演
B. 因果链导出 + 基线:写 Praxeon 事件导出脚本 → 攒第一批结构化决策链 → 测现成模型的迎合基线 = Lumen L0.0+L0.1 预演
写下你的一周第一步
▶ 预期输出(点开对照)
(具体到「周几做什么」:例:周一跑 02 课 Ollama 探针;周三写 10 条火星 SFT 数据;周六跑 10 步试训练)
✅ 检查点:你选好了毕业项目,并写下了一周内第一步动作。
🧪 交互实验 · 云 GPU 成本计算器

算清「从零训一个模型要多少钱」——拖动模型规模和数据量,看租卡成本。注意:真实成本是估算的 3–5 倍(中间实验)。

100B

对照:Rung 1(0.5–1B)是数百元级;Rung 3(7B+)是数千–数万元级。这个数量级认知,决定你该从哪一档开始。

❓ 老师答疑(卡住了先看这里)

❓ 追平旗舰有没有可能?
诚实回答:通用能力追平旗舰是资源问题(几十万卡/数亿美元),不是努力问题。但你的差异化不在「更大」,在「行为层自决 + 数据主权」——这正是旗舰做不到的。
❓ 为什么「先小后大」是省钱不是绕路?
50M 上验证超参/数据/代码,成本几乎为零;直接上 7B 试错一次就是数千元。缩放定律还保证小模型 60% 步数的曲线可预示大模型——先小后大是最高效的路径,不只是最便宜的。
❓ 毕业项目 A 和 B 选哪个?
看你更想练哪端:A 练「数据 + 微调 + 评估」全流程(更完整);B 练「数据管道 + 基线测量」(更贴近 Lumen 当前阶段)。条件允许就都做——A 是 B 的自然延续。
❓ 这门课学完,下一步是什么?
回到 Lumen 迭代路线:你的 14 课能力 = L0.0–L0.3 的底座。下一步是按路线图跑 L0.0(数据管道)→ L0.1(评估集与基线)→ L0.2(第一次微调)——你现在已经能亲手做了。

📝 自测清单(全勾才算过)

全勾 → 节点 14 / 14 完成。未勾 → 回看对应步骤,别急着往前走。

📚 推荐资料