AI 学院 · LLM 大模型线 · 可复现实验

LLM 大模型
从小型实验到训练、评估与部署

体系化步骤 + 核心技术 + 开源/闭源模型案例拆解。你会亲手训练或微调适合个人资源的小型模型,并建立数据、评测、运行谱系与部署能力;课程不会把“能跑通实验”伪装成“训练出旗舰模型”。

关联:Lumen 迭代路线(docs/research/lumen-iteration-roadmap.md)的能力底座 · 与「学习路径」互补:学习路径教「用 AI」,本课程教「造 AI」。

📌 课程承诺(三条铁律)

  • 评估先于训练:没有可证伪的评估,就没有资格说「变好了」
  • 大跑之前小跑必须已通:每次只放大一个维度
  • 每次运行留 manifest:数据哈希 + 代码哈希 + 超参 + 评估 → 可复现谱系

0 → 1 体系化路线 THE PIPELINE

全课程把实验做成一条可重复的流水线:先定义任务与评测,再准备数据、训练或后训练、回归评估并部署。任何一步都可以停在“练能力”层面;不要因算力不足跳过证据与复盘。

① 认知
目标分层 · 条件盘点
② 评测设计
任务 · 基线 · 阈值
③ 数据
语料 · 清洗 · 配比
④ 训练
架构 · 目标 · 实操
⑤ 后训练
SFT · 偏好优化
⑥ 回归评估
结果 · 失败 · 安全
⑦ 部署
量化 · 服务化
⑧ 演化
监控 · 版本 · 迭代

课程目录 14 NODES

建议顺序学习;动手节点(07/08)需要 Python 地基。每课末尾有自测清单,全勾才算过。

📖 手把手课怎么用(全部 14 课均为手把手实操版):每一课都是「老师带做」——① 看本课目标;② 按步骤卡片逐条操作(每条命令可一键复制,点开「预期输出」对照,出错看「怎么办」);③ 做完点「我完成了这一步」自动存档;④ 卡住先看老师答疑,再做交互实验加深理解。步骤进度自动保存于本机浏览器。
⏱ 时间预估:全部课程纯操作时间约 13–14 小时;按新手真实体验(含首次装环境、试错、挂机训练等待)约 20–25 小时,可按每日 2 小时拆成 2–3 周
· 01–06 纯理解 + 轻操作,节奏快(约 4.5 小时);07/08 实操高峰,含挂机训练(约 3.5–5 小时);09–14 操作少、思考多(约 5.5 小时)。
· 只想先上手:02 → 07 → 08 → 10 四课约 8 小时即可亲手训出并微调第一个模型。
01
一张诚实的 0→1 路线图认知 · 手把手
三步纸面作业:目标分层 → 条件盘点(含配置计算器)→ 写自己的阶梯计划。
02
LLM 是什么:亲手摸一个真模型认知 · 手把手
装 Ollama → 跑起真实小模型 → 看 token 切分 → 改温度看行为变化。每步带命令、预期输出与检查点。
03
数据工程:亲手下载、清洗、导出第一批语料数据 · 手把手
下载真实语料 → 写清洗脚本 → 导出带元数据 JSONL → 去污染检查。含 JSONL 查看器。
04
Tokenizer 与数据配比:亲手切开 token数据 · 手把手
跑真实 tokenizer 对比中英文效率 → 认识 SentencePiece → Chinchilla 计算器算数据量。
05
Transformer 架构深入:动手算一次注意力预训练 · 手把手
手算注意力 → 注意力热力图可视化 → KV cache 显存计算器 → 读懂 MoE 总参数/激活参数。
06
训练目标与缩放定律:亲手算 loss 和成本预训练 · 手把手
手算交叉熵 → loss 曲线解读器(4 种形态)→ 用 FLOPs 公式估算训练成本。
07
从零预训练实操:亲手训出第一个模型预训练 · 手把手
六步走:环境 → nanoGPT → 莎士比亚试跑 → TinyStories → 50M 训练 → 采样评估。含 loss 曲线模拟器。
08
指令微调 SFT:把你的数据训进 Qwen 里后训练 · 手把手
数据准备 → 试跑 → 500 步 QLoRA 微调 → 合并 → 前后对比评估。含数据格式检查器。
09
对齐与 RL:亲手设计一条防迎合奖励后训练 · 手把手
识别迎合 → 设计 DPO 偏好对 → GRPO 组内优势计算器 → 写防奖励骇客规则。
10
评估体系:亲手设计一条迎合探针评估 · 手把手
理解三类评估 → 设计探针(含判定练习)→ 写迷你评估集 → 预注册阈值跑基线。
11
推理与部署:亲手部署 + 量化一个模型部署 · 手把手
部署本地模型 → 算显存账 → 量化对比 → 用 MLX 跑自己微调的模型。含成本计算器。
12
开源模型案例拆解:用五维框架拆 DeepSeek / Qwen / Llama案例 · 手把手
五维拆解框架 → 拆 DeepSeek-V3 → 算 MoE 账 → 跑 R1 蒸馏小模型。含拆解工作台。
13
闭源模型案例拆解:黑盒反推 GPT / Claude / Gemini案例 · 手把手
黑盒拆解方法论 → 设计探针测三家 → 读系统卡 → 选型决策树。
14
规模化路线:定你的 Rung 计划,走向持续演化收束 · 手把手
画 Rung 阶梯 → 云 GPU 成本计算器 → 设计演化回路 → 建训练谱系 → 选毕业项目。

开源 vs 闭源 · 案例矩阵 CASE MATRIX

第 12/13 课拆解的模型一览。模型版本、权重访问、许可证、上下文与价格会变化;表中仅用于建立分析框架,项目选型必须回到对应模型卡、许可证、系统卡与当前服务文档复核。

模型权重访问 / 许可规模(公开披露)架构或产品要点训练 / 证据边界对课程的意义
DeepSeek-V3公开权重;以模型卡许可为准公开资料中有披露MoE 与注意力/推理工程的案例训练数据、成本和复现条件须回到技术报告核验用来练习“架构—数据—计算—评测”拆解,而非照抄数字
DeepSeek-R1公开权重;以模型卡许可为准存在不同尺寸与蒸馏变体推理与后训练研究案例应区分技术报告公开内容、复现结果与未经验证的机制猜测练习将奖励、评测、推理成本与安全风险放在同一张表里
Qwen 系列多个公开权重版本;逐版本核验许可含稠密与 MoE 变体多语言、工具使用与推理能力的实践案例训练 token、后训练与能力声明以对应技术报告为准用于中文任务、许可、部署成本与评测取舍练习
Llama 系列公开权重;通常为自定义许可而非通用“开源”同义词按具体版本模型卡确认规模化部署、生态与多模态策略案例宣传指标须与独立评测、许可条款和可复现实验交叉验证练习识别“可获取权重”与“可自由使用”之间的差异
Mistral / Mixtral不同版本的权重访问与许可不同按具体版本模型卡确认稠密与 MoE 的工程比较案例勿将历史版本许可外推至全部后续模型练习根据许可证、显存、延迟和质量选择部署路线
GPT(OpenAI)闭源服务未公开产品化模型选择、工具与推理模式案例训练细节未完整公开;应以官方文档、系统卡与实际评测为依据练习闭源 API 的质量、成本、数据政策与退出方案评估
Claude(Anthropic)闭源服务未公开安全策略、工具使用与产品交互案例公开信息不足以还原完整训练过程;通过系统卡和任务测试理解边界练习将行为要求、安全政策和真实任务评测分开记录
Gemini(Google)闭源服务未公开多模态、长上下文与工具链案例模型能力随版本与服务配置变化,应通过场景化评测确认练习比较不同输入模态、上下文和成本约束下的产品取舍

学习进度 PROGRESS

进度保存在本机浏览器(localStorage),点节点完成即打勾。手动点击下面的节点可切换完成状态:

0 / 14 节点已完成(全勾 = 课程通关)

怎么用这门课 HOW TO USE

  • 顺序学习:01→14 构成建议依赖顺序;评测在训练前定义基线和阈值,在训练后做回归验证,案例建立在架构与数据知识之上。
  • 动手节点不可跳过:07(从零预训练)与 08(SFT)是本课程的灵魂,跑通才算数。
  • 与 Lumen 的关系:本课程 = Lumen 路线 L0.0–L0.3 的能力底座;学完毕业项目即 Lumen 预演(见 14 课)。
  • 与学习路径互补:学习路径(130 天)教「用 AI 造应用」,本课程教「造 AI 本身」——时间充裕可并行,否则先完成学习路径主干。