怎么用这张图:AI 建立在四院之上——数学给骨骼、语言给血肉、科学给证据、商业给目标。从「根」往下走 = 知识流向;点开节点看定义与要点;「怎么学」指向本学院课程,「关联」跳转对应学院。跨学院的知识只跳转、不重复。
地基 AI 的根 · 一切从这里长出来
AI 不是无源之水:数学给骨骼、编程给手脚、数据给食物——地基决定 AI 能长多高。
数学地基 地基
AI 的骨骼——所有模型的运算都建立在数学上。
- 线性代数:向量、矩阵、特征值——神经网络的计算语言
- 微积分:导数、梯度——训练模型(梯度下降)的引擎
- 概率统计:分布、期望、贝叶斯——理解不确定性与模型输出
- 优化:让损失最小化——模型训练的本质
编程基础 地基
让想法变成能跑的程序——AI 工程师的基本功。
- Python:AI 生态的通用语言(NumPy / PyTorch / transformers 全用它)
- 数据结构:列表、字典、集合——组织数据的容器
- 函数与模块:封装逻辑、复用代码、import 站在巨人肩上
数据基础 地基
AI 的食物——没有干净的数据,模型无从谈起。
- 获取:公开数据集、API、爬虫
- 清洗:去脏、补缺、统一格式——真实项目 60% 时间在清洗
- 标注:分类、实体、对齐——监督学习的燃料
- 口径:同一定义与度量,避免「垃圾进,垃圾出」
- 合成数据:用模型生成训练数据(标注 / 扩充)——数据不够时的解法
计算机基础 地基
逻辑与算法思维 地基
拆解问题、评估复杂度、守住边界——程序员的核心能力。
- 问题分解:大问题拆成可执行的小步骤
- 复杂度:O(n) / O(n²)——数据大了会不会崩
- 边界:空输入、异常、极端值——健壮性的来源
主干 六大核心分支 · AI 世界的支柱
从地基长出六根主干:机器学习→深度学习→大语言模型→应用工程→对齐安全,数据与软件工程贯穿全程。
机器学习 主干
从数据中自动学习规律,而非人工写死规则。
- 三范式:监督(有答案)/ 无监督(找结构)/ 强化(试错 + 奖励)
- 经典算法:线性/逻辑回归、决策树/随机森林、SVM、KNN
- 全流程:数据 → 特征 → 训练 → 评估 → 调优
- 核心敌人:过拟合(记住答案而非学会规律)——用验证集发现
- 评估:准确率不够,看 精确率 / 召回率 / F1
深度学习 主干
用多层神经网络从数据学习表示——在视觉、语音与生成任务中尤其重要,但应按任务、数据与成本选择。
- 神经网络:线性变换 + 非线性激活,逐层抽象
- 训练:正向传播算损失,反向传播算梯度,更新参数
- CNN:图像(局部感受野)|RNN / Transformer:序列
- 生成模型:GAN / 扩散——从数据分布生成新样本
大语言模型 主干
当前 AI 的重要技术路线之一——在大规模文本或多模态数据上训练,能生成并处理语言任务的模型。
- Token:文本切成最小单元
- Transformer:以注意力为核心的架构,支撑许多语言与多模态模型;生成时仍通常按 token 逐步解码
- 预训练:预测下一个词(自监督),学到语言规律
- RLHF:利用偏好或反馈做后训练的技术族;可改善特定行为,但不能替代评估、安全工程与人工监督
- 能力随规模变化:部分任务曲线看似出现跃迁,但受任务、指标与实验设置影响,需以可复现实验审查
AI 应用工程 主干
把模型能力封装成可用产品——从调 API 到造 Agent。
- API:调用模型,结构化输入输出
- Function Calling:让模型调用工具 / 查数据
- RAG:检索增强生成——先查资料再回答(治幻觉)
- Agent:模型 + 工具 + 循环 = 自主完成任务
- MCP:统一工具接入协议
- 上下文工程:把「喂什么给模型」当工程做——长上下文 / 检索 / 记忆编排
- 评测 Evals:质量 / 成本 / 延迟的度量体系——没有度量就没有优化
对齐与安全 主干
让 AI 的能力与人类意图一致,且不被滥用。
- 对齐工程:RLHF / 微调 / 提示工程——让模型说人话、办人事
- 红队:主动攻击找漏洞(提示注入、越狱)
- 可解释:理解模型为什么这么输出
- 治理:隐私、版权、滥用风险
- Agent 安全:工具调用权限、MCP 供应链风险——越权与注入是新的攻击面
数据与软件工程 主干
AI 生产的底座——数据管道 + 工程规范,让项目可维护、可复现。
- ETL:抽取 → 转换 → 加载(数据管道)
- 测试:pytest / jest——没有测试的项目是隐患
- CI/CD:自动化构建与部署
- 可复现:版本锁定、种子固定
深入 深入与前沿 · 每根主干的深水区
从原理细节到工程优化——当代 AI 研究与实践仍在快速突破的地方。按需点入,不必一次学完。
Transformer 深入 深入
推理模型 深入前沿
高效调优 深入
用更少资源让模型适配任务——微调与压缩的工程学。
- 微调:全参 / 指令微调,让通用模型变专用
- LoRA:低秩适配——只改一小部分参数,效果接近全参
- 量化:精度换速度与显存
- 蒸馏:大模型教小模型,能力浓缩
强化学习与 RLHF 深入
通过试错与奖励训练决策;RLHF 让大模型对齐人类偏好。
- MDP:状态 / 动作 / 奖励——决策问题的框架
- 策略与奖励模型:怎么做(策略)、好不好(奖励)
- PPO:主流的策略优化算法
- RLHF 三阶段:SFT → 奖励模型 → 强化学习
Agent 架构 深入
让模型自主规划、调用工具、完成任务闭环——AI 从「对话」到「干活」的跃迁。
- Harness(运行框架):模型是大脑、harness 是躯干——提供工具调用循环、状态管理、权限边界、上下文管理;Claude Code、OpenAI Agent Kit 都是 harness 实例
- 规划:把大任务拆成子步骤
- 工具调用:查库、算数、执行代码、操作网页
- 记忆:短期(会话)/ 长期(向量库 / 文件)
- 多智能体:分工协作,各司其职
生成模型前沿 深入
从数据分布生成新内容——图像、音频、视频、世界模型。
- 扩散模型:逐步去噪,从噪声还原图像(Stable Diffusion 的基础)
- 多模态:文生图 / 音 / 视频,跨模态理解
- 语音 AI:实时语音对话、语音克隆——交互的新形态
- 方向:世界模型——让模型理解物理世界
可解释性研究 深入
打开黑箱,理解模型内部机制——知道它为什么这么想。
- 注意力可视化:看模型「注意」哪里
- 探针:检查内部向量编码了什么
- 机制可解释性:找「特征电路」——可解释的起点
源码精读 深入
读真实实现,把「会调 API」变成「懂原理」。
- micrograd:100 行实现反向传播——最小可读的深度学习内核
- PyTorch:核心张量与 autograd
- transformers 库:模型加载、推理、微调的工程真相
- 自写:从零搭一个小模型 / 一个小 Agent
推理与分布式 深入
让模型跑得快、跑得动——部署与规模化的工程。
- 推理加速:KV 缓存、批处理、投机采样
- 量化部署:低精度推理省显存
- 分布式训练:多卡并行(数据 / 模型 / 流水线)
- 显存优化:梯度检查点、混合精度
- 本地部署:ollama / llama.cpp 跑自己的模型——隐私与成本
走向 走向 · AI 通往哪里
AI 不是孤岛——每个方向都通向真实的领域。学到能用的程度,就走到这里。
👨💻 AI 编程 走向前沿
用 AI 写代码——从「写」到「指挥」,2025 年生产力变革最大的方向。
- 工具:Cursor、Claude Code、GitHub Copilot;vibe coding——说需求出代码
- 能力:生成 / 重构 / 测试 / 调试,甚至 Agent 化自主完成编码任务
- 意义:「会编程的人 + AI」的生产力远高于不会编程的人——学会审代码比写代码更重要
- 风险:幻觉代码、安全漏洞——必须人工审阅、测试兜底
🔎 AI 搜索与深度研究 走向前沿
搜索 + 推理 + 多步信息收集,产出带引用的研究报告(Deep Research)。
- 流程:拆解问题 → 多路搜索 → 阅读提炼 → 交叉验证 → 生成报告
- 代表:ChatGPT Deep Research、Gemini Deep Research、Perplexity 等
- 价值:把「查资料」从小时级降到分钟级——调研 / 对比 / 论文综述的好帮手
- 局限:关键结论仍需人工核验(引用的真实性、时效性)
🛠️ 产品与 SaaS 走向
📊 数据智能 走向
🧪 学术验证 走向
AI 辅助论文初筛、复现与写作——DOXA 的初心出口。
- 完整性 / 可复现性初筛(三态标签:已验证 / 存疑 / 未复现)
- 两轨内容:人类论文 + AI 论文,AI 推进学科是主引擎
🤖 数字员工 走向
🎓 学习辅助 走向
⚖️ 安全与治理 走向
这张图和 AI 学院内容线的关系
| AI 学院 · 线 | 在这张图上的位置 | 回答的问题 |
|---|---|---|
| 学习路径 · 130 天 8 模块 | 地基 → 主干全系 → 深入 → 走向(毕业项目) | 从 0 到独立创造 AI 应用 |
| Python 地基 · 9 节点 | 地基(编程 / 数据 / 计算机) | 让 AI 学得动 |
| LLM 大模型线 · 14 节点 | 主干(造 AI 本身):数据 → 预训练 → SFT/RL → 评估 → 部署 → 案例 | 从 0 到 1 训练自己的大模型 |
| 数学地基(→ 数学院) | 地基(数学)→ 深入(优化 / 统计) | 让 AI 立得住 |
| 实践节点(毕业项目) | 走向(产品 / 科研 / 数据) | 让 AI 用起来 |
学习路径、Python 地基与 LLM 大模型线是这张图的三条「执行线」;数学、语言、科学、商业四院知识直接跳转对应学院图谱,不在本页重复。完整课程体系与学习安排见 DOXA 内部(docs/academies/ai.md)。
说明:AI 建立在四院之上——数学给骨骼,语言给血肉,科学给证据,商业给目标。本图按主流 AI 知识结构梳理,箭头表示「依赖 / 流向」而非严格偏序;同一分支常有多条来路,此处取其主干。每个节点的知识 = 一句话定义 + 核心要点,够理解、够判断、够开始学习;深入细节沿「怎么学」进入课程。
