本课模式:四步走——学会五维拆解框架 → 亲手拆 DeepSeek-V3 → 算 MoE 账 → 跑 R1 蒸馏小模型。做完你能读懂任何开源模型的技术报告。
📋 本课你将完成
- 能用五维框架拆解任意开源模型
- 亲手拆过 DeepSeek-V3(架构/数据/训练/对齐/许可)
- 算清 MoE 的「总参数 vs 激活参数」
- 跑过一次 R1 蒸馏小模型
- 说出从开源案例学到的五条经验中至少三条
步骤 1
学会五维拆解框架(10 分钟)
未完成🎯 这一步的目标:任何模型的技术报告,都按这五维读——不迷路。
▶ 预期输出(点开对照)
① 架构:参数量/激活量/层数维度/注意力变体/MoE ② 数据:语料量/配比/清洗/多语言 ③ 训练:预训练 token/学习率策略/训练成本 ④ 对齐:SFT 数据/RL 方法/奖励设计 ⑤ 许可:权重可商用吗/协议限制
✅ 检查点:你能背出五维框架。
步骤 2
亲手拆 DeepSeek-V3(20 分钟)
未完成🎯 这一步的目标:用五维框架拆 2024 年底震撼业界的模型——约 550 万美元训出 GPT-4 级。
▶ 预期输出(点开对照)
架构:MoE 总 671B / 激活 37B;MLA 压缩 KV cache 90%+;DeepSeekMoE 细粒度专家 数据:14.8T tokens,数学/代码占比高 训练:FP8 混合精度 + 专家并行,硬件利用率极高 对齐:SFT + RL(RL 数据用可验证奖励) 许可:MIT(可商用)
python3 -c 'total=671e9; active=37e9', 'print(f"推理算力 ≈ {active/1e9:.0f}B 稠密模型(激活决定)" )', 'print(f"显存要装 {total/1e9:.0f}B(总参数决定)" )'▶ 预期输出(点开对照)
推理算力 ≈ 37B 稠密模型(激活决定) 显存要装 671B(总参数决定)
✅ 检查点:你能解释「为什么 671B 推理不算贵,但显存不小」。
步骤 3
拆 R1:纯 RL 涌现推理(15 分钟)
未完成🎯 这一步的目标:理解 R1 为什么是里程碑,以及它给 Lumen 的论据。
▶ 预期输出(点开对照)
R1-Zero:不 SFT,纯 GRPO + 规则奖励(答案可验证)→ 推理能力自己涌现 R1:加冷启动 SFT + 可验证奖励 + 语言一致性奖励 → 稳定推理链 开源贡献:80 万条推理数据 + 蒸馏小模型(1.5B/7B)
✅ 检查点:你能解释 R1 为什么证明「确定性验证奖励 + RL = 能力涌现」。
步骤 4
跑一次 R1 蒸馏小模型(15 分钟)
未完成🎯 这一步的目标:亲手跑 1.5B 蒸馏版,亲眼看推理能力——小模型也能做「推理」。
ollama pull deepseek-r1:1.5b
ollama run deepseek-r1:1.5b
请一步步推理:3 个人 3 天盖 3 间房,9 个人 9 天盖几间?▶ 预期输出(点开对照)
(模型会输出带「思考过程」的推理链——注意看它先推理再回答,这就是 R1 风格)
ollama run qwen3:3b
请一步步推理:3 个人 3 天盖 3 间房,9 个人 9 天盖几间?▶ 预期输出(点开对照)
(对比两个模型的思考方式差异——推理模型的「想清楚再说」特征)
✅ 检查点:你跑过 R1 蒸馏小模型,并观察到它的推理链风格。
🧪 交互实验 · 五维拆解工作台
选一个模型,看它的五维快照——然后自己动手补一维(去技术报告/官网查证最新数据)。
注意:规模数字随版本更新,动手前先去官方技术报告复核——这本身就是「五维拆解」的练习。
❓ 老师答疑(卡住了先看这里)
❓ MoE 到底省什么、费什么?
省推理算力:每次只激活部分专家(37B/671B),算力按激活量走。费显存:全部权重都要载入。所以 MoE 适合「训练省钱、推理算力友好、但显存大」的场景——这也是 DeepSeek 推理 API 便宜的原因。
❓ R1 的「推理涌现」是魔法吗?
不是。它是「可验证奖励 + 强化学习」的必然结果:模型在探索中学会「想清楚了再答更可能拿分」。这给 Lumen 的启示:确定性引擎奖励 → 行为会自发优化。
❓ 为什么说 Qwen 是首选基座?
Apache-2.0 许可(最省心)+ 中文 tokenizer 高效(第 04 课)+ 混合推理 + 生态成熟。对 Lumen 的行为层需求(可微调、可商用、数据主权),Qwen 是综合最优。
❓ Llama 4 的 Benchmark 争议说明什么?
说明评估纪律的重要:测试集混入训练语料 = 分数虚高。这印证了本课程第 03/10 课的「去污染 + 隐藏集」不是洁癖,是行业级事故的高发区。
📝 自测清单(全勾才算过)
- 能用五维框架拆解任意开源模型
- 亲手拆过 DeepSeek-V3(架构/数据/训练/对齐/许可)
- 算清 MoE 的「总参数 vs 激活参数」
- 跑过一次 R1 蒸馏小模型
- 说出从开源案例学到的五条经验中至少三条
全勾 → 节点 12 / 14 完成。未勾 → 回看对应步骤,别急着往前走。