AI 学院 · 90 天课程 · AI 世界观

AI 世界观

从零认识 AI:概念、历史、神经网络与 LLM 入门。共 10 天,每天完整收录:学习目标、核心内容、关键概念、实际案例、思考题等。

范围 Day 1–10天数 10内容 完整课程
本模块:AI 世界观(Day 1–10)。每天一个主题,完整讲解 + 案例 + 思考题,按顺序学习。
DAY 1 / 90

什么是人工智能?

学习目标

今天学完,你能清晰区分人工智能、机器学习和深度学习这三个常被混淆的概念,并理解弱人工智能和强人工智能的本质区别。

---

核心内容

一、人工智能(AI)—— 大树的根基

人工智能(Artificial Intelligence,AI)是计算机科学的一个分支,目标是让机器模拟人类智能。这里的"智能"包括:理解语言、识别图像、推理决策、学习经验等。

💡 类比:想象你教一个孩子认识世界。AI 就像那个"被教导的孩子"——通过某种方式获得"知识"和"能力"。

AI 可以分为两大类:

  • 弱人工智能(Narrow AI):专门解决特定任务,比如下棋、识别猫狗、语音助手。这是当前我们所见的一切 AI。AlphaGo、ChatGPT、Siri 都属于弱 AI。
  • 强人工智能(General AI / AGI):具有与人类相当或超越人类的通用智能,可以像人一样思考、学习、解决各种新问题。目前尚未实现,这是科幻和研究的终极目标。

⚠️ 注意:很多人误以为 ChatGPT 已经"有思想"了,其实它只是极其复杂的模式匹配工具,离真正的 AGI 还有很远。

二、机器学习(Machine Learning)—— 让机器自学的方法

机器学习是实现 AI 的核心方法之一。传统编程是"人写规则,机器执行";机器学习则是"人给数据,机器自己发现规则"。

💡 类比:传统编程就像你给女儿写一本《如何识别苹果》的说明书(圆圆的、红色的、有柄)。机器学习则是你给她看成千上万张苹果照片,她自己总结出"苹果长什么样"。

机器学习有三种主要学习方式:

  1. 监督学习:有"标准答案"的学习。比如给机器看很多标注了"猫"或"狗"的照片,让它学会分类。
  2. 无监督学习:没有标准答案,让机器自己发现数据中的规律。比如把客户按购买行为自动分成不同群体。
  3. 强化学习:通过试错和奖励来学习。比如训练机器玩游戏,得分高就"奖励",让它逐渐找到最优策略。

三、深度学习(Deep Learning)—— 机器学习的"升级版"

深度学习是机器学习的一个子集,它使用多层神经网络(Neural Networks)来自动提取数据的特征。

💡 类比:机器学习像一个学生,需要老师(人类)告诉他"看颜色、看形状、看纹理"来识别苹果。深度学习则像一个更聪明的学生,老师只给照片,他自己决定该看哪些特征——而且可能发现人类都注意不到的微妙特征(比如苹果表面反光的方式)。

深度学习的关键是神经网络,它模拟了人脑神经元的工作方式。一个"深度"神经网络通常有几十层甚至上百层,每一层都在提取不同级别的特征:

  • 第一层:识别边缘、颜色
  • 中间层:识别形状、纹理
  • 深层:识别复杂物体(如猫的脸、车的轮廓)

三者的关系总结: `` 人工智能(AI)—— 最广泛的目标 └── 机器学习(ML)—— 实现 AI 的主要方法 └── 深度学习(DL)—— ML 中最强大的技术 ``

---

关键概念
  1. 人工智能(AI):让机器模拟人类智能的科学与技术。
  2. 机器学习(ML):AI 的子领域,让机器从数据中学习规律。
  3. 深度学习(DL):ML 的子领域,使用深层神经网络自动学习特征。
  4. 神经网络(Neural Network):模拟人脑神经元连接的计算模型。
  5. 弱 AI vs 强 AI:弱 AI 专精一个任务;强 AI 具有通用智能,目前只存在于理论中。

---

实际案例

案例1:你手机里的 AI

  • 当你用面容解锁 iPhone 时,深度学习在分析你面部特征的三维结构。
  • 当你拍照片,手机自动识别出"人物""风景""美食"时,这是机器学习在分类。
  • 当你说"嘿 Siri,明天8点叫我起床",Siri 理解你的语言并设置闹钟,这是自然语言处理(NLP),一种 AI 应用。

案例2:推荐系统

  • 抖音刷视频、淘宝猜你喜欢、网易云每日推荐——背后都是机器学习在分析你的历史行为,预测你可能喜欢的内容。

---

思考题

ChatGPT 能写诗、能写代码、能和你聊天,它是不是"强人工智能"?为什么?

---

延伸阅读
  1. 📺 3Blue1Brown - Neural Networks:用最直观的动画讲解神经网络

👉 https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_67000Dx_ZCJB-3pi

  1. 🎓 MIT Introduction to Deep Learning:MIT 公开课

👉 https://www.youtube.com/playlist?list=PLtBw6njQRU-rwp5__7Cvo4U4GMsyWnExO

---

GitHub 推荐

microsoft/ML-For-Beginners — 微软官方的机器学习入门课程

  • 🔗 链接:https://github.com/microsoft/ML-For-Beginners
  • 📊 Stars:68,000+ | 📝 Jupyter Notebook / Python

一句话介绍:12 周、26 节课、52 个测验的免费机器学习课程,专为零基础设计,有完整中文翻译。

---

📌 课程进度:Day 1 / 90 | 模块1:AI世界观

🎓 明天预告Day 2 AI发展简史 —— 从图灵测试到ChatGPT,三次AI浪潮!

---

DAY 2 / 90

AI发展简史

学习目标

了解 AI 发展的三次浪潮与关键里程碑,理解每个阶段的核心技术和局限性。

---

昨日回顾

Day 1:什么是人工智能?

昨天我们建立了 AI 的宏观认知框架:

  • AI 是让机器模拟人类智能的总目标
  • 机器学习(ML) 是实现 AI 的核心方法
  • 深度学习(DL) 是 ML 中最强大的技术
  • 当前所有 AI(包括 ChatGPT)都是弱 AI

今天我们将沿着时间线,看看 AI 是如何一步步发展到今天的。

---

核心内容

一、第一次浪潮:符号主义时代(1950s-1980s)

核心理念:智能 = 符号操作。如果能把人类的知识用符号和规则表示出来,机器就能推理。

关键事件

  • 1950:图灵测试提出
  • 1956:达特茅斯会议——"人工智能"一词正式诞生
  • 1960s-1970s:专家系统(Expert Systems)兴起

- MYCIN:医疗诊断系统

- DENDRAL:化学分析系统

为什么会衰落?

  • 知识获取瓶颈:专家的知识很难被提取成规则
  • 常识问题:人类常识无法穷举
  • 计算能力有限

二、第二次浪潮:统计学习时代(1980s-2010s)

核心理念:不要教机器规则,让机器从数据中学习统计规律。

关键技术

  • 1980s:神经网络复兴(反向传播算法)
  • 1990s:支持向量机(SVM)、随机森林
  • 2012:AlexNet——深度学习的历史性突破

三、第三次浪潮:深度学习时代(2012-至今)

核心理念:数据 + 算力 + 算法 = 智能。

里程碑时间线

年份事件意义
2012AlexNet深度学习复兴
2014GAN 提出生成模型新时代
2016AlphaGo 击败李世石AI 超越人类顶尖棋手
2017Transformer 论文注意力机制革命
2018BERT预训练模型元年
2020GPT-3上下文学习涌现
2022ChatGPTAI 大众化元年
2023GPT-4多模态 + 推理
2024Sora视频生成突破
2025-2026Agent/Reasoning 爆发AI 从聊天到行动

四、当前阶段:大模型 + Agent 时代

  • 大语言模型(LLM) 成为通用接口
  • Prompt Engineering 成为新技能
  • AI Agent 让模型能调用工具、自主行动
  • 多模态 让 AI 能看、能听、能读

---

关键概念
  1. 图灵测试(Turing Test):如果人类无法区分对话对象是机器还是人
  2. 达特茅斯会议(1956):AI 作为学科的诞生地
  3. 专家系统:基于规则的知识库系统
  4. ImageNet 时刻:2012 年 AlexNet 的突破

---

实际案例

案例:AlphaGo 的三次进化

版本年份技术战绩
AlphaGo2016深度学习 + 蒙特卡洛树搜索4:1 击败李世石
AlphaGo Zero2017纯强化学习100:0 击败 AlphaGo
AlphaZero2018通用算法统一超越人类

AlphaGo Zero 的意义:证明了 AI 可以在没有人类知识的情况下,通过自我对弈达到超人类水平。

---

思考题

第一次 AI 浪潮(符号主义)和第三次浪潮(深度学习)的根本区别是什么?为什么符号主义失败了,而深度学习成功了?

---

延伸阅读
  1. 📺 AlphaGo 纪录片:Netflix 出品

👉 https://www.netflix.com/title/80190844

  1. 📄 Attention Is All You Need(Transformer 原始论文)

👉 https://arxiv.org/abs/1706.03762

---

GitHub 推荐

google-research/google-research — Google 研究团队官方代码仓库

  • 🔗 链接:https://github.com/google-research/google-research
  • 📊 Stars:35,000+

为什么推荐:包含 Transformer、BERT、T5 等里程碑工作的原始实现。

---

📌 课程进度:Day 2 / 90 | 模块1:AI世界观

🎓 明天预告Day 3 机器学习的核心思想 —— 训练数据、模型、预测的全流程!

---

DAY 3 / 90

机器学习的核心思想

学习目标

理解"让机器从数据中学习"的本质,掌握训练数据、模型、预测的核心流程。

---

昨日回顾

Day 2:AI发展简史

昨天我们走过了 AI 的三次浪潮:

  • 第一次:符号主义,用规则模拟智能
  • 第二次:统计学习,AlexNet 开启深度学习
  • 第三次:深度学习 + 大模型,数据 + 算力 + 算法的爆发

关键启示:AI 的进步往往来自数据、算力、算法三者的协同突破

---

核心内容

一、机器学习的本质

传统编程: `` 人写规则 → 机器执行 → 得到结果 ``

机器学习: `` 人给数据(输入 + 输出)→ 机器发现规则 → 用规则预测新数据 ``

💡 类比:传统编程就像你给学生一本《数学公式手册》。机器学习就像你给学生 1000 道数学题和答案,让他自己总结规律。

二、核心三要素

要素说明类比
数据(Data)学习的原材料教科书和习题
模型(Model)学习到的规律学生总结的知识体系
算法(Algorithm)学习的方法学生用的学习策略

三、学习范式概览

机器学习
├── 监督学习(Supervised Learning)
│   ├── 分类(Classification):预测类别
│   └── 回归(Regression):预测数值
├── 无监督学习(Unsupervised Learning)
│   ├── 聚类(Clustering):发现数据分组
│   └── 降维(Dimensionality Reduction):简化数据
└── 强化学习(Reinforcement Learning)
    └── 策略学习:学习最优行动策略

四、训练流程

1. 数据收集 → 2. 数据预处理 → 3. 特征工程
      ↓
4. 选择模型 → 5. 训练(拟合数据)→ 6. 评估
      ↓
7. 调优 → 8. 部署 → 9. 监控与迭代

⚠️ 常见误区:很多人以为机器学习就是"丢数据进去,模型自己变聪明"。实际上,数据质量、特征设计、模型选择每一步都需要人的智慧和经验。

---

关键概念
  1. 训练数据(Training Data):用于训练模型的数据
  2. 测试数据(Test Data):用于评估模型性能的数据
  3. 特征(Feature):描述数据的属性/变量
  4. 标签(Label):数据的期望输出
  5. 泛化(Generalization):模型对未见过数据的预测能力

---

实际案例

案例:垃圾邮件过滤器

传统编程方式

  • 人写规则:如果邮件包含"免费""中奖"→ 垃圾邮件
  • 问题:垃圾邮件发送者会不断变换话术

机器学习方式

  • 收集 10 万封邮件,人工标注"垃圾"或"正常"
  • 模型学习:哪些词汇组合对应垃圾邮件
  • 自动适应:新类型出现,只需重新训练

💡 关键洞察:机器学习让系统能自动适应变化

---

思考题

假设你要用机器学习预测明天会不会下雨,你需要什么数据?这些数据属于"特征"还是"标签"?

---

延伸阅读
  1. 📖 Google 机器学习速成课程

👉 https://developers.google.com/machine-learning/crash-course

  1. 📺 吴恩达机器学习课程

👉 https://www.coursera.org/learn/machine-learning

---

GitHub 推荐

ScrapeGraphAI/Scrapegraph-ai — 基于 AI 的 Python 爬虫框架

  • 🔗 链接:https://github.com/ScrapeGraphAI/Scrapegraph-ai
  • 📊 Stars:18,000+

一句话介绍:使用 LLM 自动提取网页数据,无需编写 XPath。

---

📌 课程进度:Day 3 / 90 | 模块1:AI世界观

🎓 明天预告Day 4 监督/无监督/强化学习 —— 三种学习范式的深入对比!

---

DAY 4 / 90

监督/无监督/强化学习

学习目标

深入理解三种学习范式的区别、适用场景和经典算法。

---

昨日回顾

Day 3:机器学习的核心思想

昨天我们掌握了 ML 的本质:

  • 传统编程:人写规则 → 机器执行
  • 机器学习:人给数据 → 机器发现规则 → 预测新数据
  • 三要素:数据、模型、算法
  • 训练流程:收集 → 预处理 → 训练 → 评估 → 部署

今天我们将深入三种学习范式。

---

核心内容

一、监督学习(Supervised Learning)

定义:用标注好的数据训练模型,模型学习"输入 → 输出"的映射。

两大任务

  • 分类(Classification):预测离散类别

- 例:邮件是垃圾/正常、图片是猫/狗

  • 回归(Regression):预测连续数值

- 例:房价、股价、温度

经典算法

  • 线性回归、逻辑回归
  • 决策树、随机森林
  • 支持向量机(SVM)
  • 神经网络

二、无监督学习(Unsupervised Learning)

定义:没有标注数据,让模型自己发现数据中的结构和规律。

主要任务

  • 聚类(Clustering):把相似数据分到一组

- 例:客户分群、文档分类

  • 降维(Dimensionality Reduction):减少数据维度

- 例:数据可视化、特征压缩

  • 关联规则:发现数据间的关联

- 例:购物篮分析(买啤酒的人也买尿布)

经典算法

  • K-Means 聚类
  • 层次聚类
  • PCA(主成分分析)
  • 自编码器

三、强化学习(Reinforcement Learning)

定义:智能体(Agent)在环境中通过试错学习,目标是最大化累积奖励。

核心概念

  • Agent:做决策的主体
  • Environment:Agent 所处的世界
  • State:当前状态
  • Action:Agent 可以采取的行动
  • Reward:采取行动后获得的反馈

💡 类比:就像训练小狗。做对了给零食(正奖励),做错了不给(负奖励),小狗逐渐学会正确的行为。

经典算法

  • Q-Learning
  • 策略梯度(Policy Gradient)
  • PPO(Proximal Policy Optimization)
  • DQN(Deep Q-Network)

四、三种范式的对比

维度监督学习无监督学习强化学习
数据有标注无标注无标注,有奖励
目标预测标签发现结构最大化奖励
反馈即时延迟
典型应用分类、回归聚类、降维游戏、机器人

---

思考题

自动驾驶汽车的学习应该属于哪种范式?为什么?(提示:它需要人类驾驶员的示范数据吗?还是需要自己在模拟环境中试错?)

---

延伸阅读
  1. 📺 DeepMind 强化学习系列

👉 https://www.youtube.com/watch?v=2pWv7GOvuf0

---

GitHub 推荐

openai/gym — 强化学习环境标准库

  • 🔗 链接:https://github.com/openai/gym
  • 📊 Stars:35,000+

一句话介绍:标准化的强化学习环境,让研究者可以比较不同算法的表现。

---

📌 课程进度:Day 4 / 90 | 模块1:AI世界观

🎓 明天预告Day 5 神经网络基础 —— 从感知机到多层网络!

---

DAY 5 / 90

神经网络基础

学习目标

理解神经网络的基本结构和工作原理,从感知机到多层网络。

---

昨日回顾

Day 4:监督/无监督/强化学习

昨天我们深入对比了三种学习范式:

  • 监督学习:有标注数据,学习输入→输出映射
  • 无监督学习:无标注,自己发现结构
  • 强化学习:通过奖励信号学习最优策略

今天我们将进入深度学习的基础——神经网络。

---

核心内容

一、感知机(Perceptron)—— 神经网络的起源

感知机是最简单的神经网络,只有一个神经元。

输入 x₁, x₂, ..., xₙ → 加权求和 → 激活函数 → 输出

数学表示: `` output = f(w₁x₁ + w₂x₂ + ... + wₙxₙ + b) ``

其中 f 是激活函数,w 是权重,b 是偏置。

💡 类比:感知机就像一个投票器。每个输入给一个"票数"(权重),超过阈值就输出 1,否则输出 0。

二、多层感知机(MLP)

把多个感知机层叠起来:

输入层 → 隐藏层 → 隐藏层 → 输出层
  • 输入层:接收原始数据
  • 隐藏层:提取特征(可以有多个)
  • 输出层:给出预测结果

💡 关键洞察:隐藏层的存在让网络可以学习非线性关系。没有隐藏层,感知机只能解决线性可分问题。

三、激活函数

激活函数给神经网络引入非线性,让它能学习复杂的模式。

激活函数公式特点
Sigmoid1/(1+e⁻ˣ)输出 0-1,适合做概率
ReLUmax(0, x)计算快,最常用
Tanh(eˣ-e⁻ˣ)/(eˣ+e⁻ˣ)输出 -1 到 1
Softmaxeˣⁱ/Σeˣʲ多分类输出概率

四、前向传播与反向传播

  • 前向传播(Forward Propagation):数据从输入层流到输出层,计算预测结果
  • 反向传播(Backpropagation):从输出层往回传误差,更新权重

💡 类比:前向传播就像考试交卷,反向传播就像老师批改后告诉你哪里错了,你回去改正。

---

关键概念
  1. 感知机(Perceptron):最简单的神经网络单元
  2. 权重(Weight):连接强度,决定输入的重要性
  3. 偏置(Bias):阈值调整,决定神经元多容易激活
  4. 激活函数(Activation Function):引入非线性
  5. 反向传播(Backpropagation):通过链式法则更新权重

---

实际案例

案例:手写数字识别(MNIST)

  • 输入:28×28 像素的灰度图(784 维向量)
  • 隐藏层:128 个神经元
  • 输出层:10 个神经元(对应 0-9)
  • 激活函数:隐藏层 ReLU,输出层 Softmax

---

思考题

如果没有激活函数(或者只用线性激活函数),多层神经网络和单层感知机有什么区别?

---

延伸阅读
  1. 📺 3Blue1Brown - 神经网络系列

👉 https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_67000Dx_ZCJB-3pi

---

GitHub 推荐

tensorflow/tensorflow — Google 深度学习框架

  • 🔗 链接:https://github.com/tensorflow/tensorflow
  • 📊 Stars:180,000+

一句话介绍:最主流的深度学习框架之一,生态丰富,工业界广泛应用。

---

📌 课程进度:Day 5 / 90 | 模块1:AI世界观

🎓 明天预告Day 6 深度学习的力量 —— 为什么深度网络比浅层网络更强?

---

DAY 6 / 90

深度学习的力量

学习目标

理解为什么深层网络比浅层网络更强,以及深度学习的核心优势。

---

昨日回顾

Day 5:神经网络基础

昨天我们学了神经网络的基本结构:

  • 感知机是最简单的神经元
  • 多层感知机(MLP)通过隐藏层学习非线性关系
  • 激活函数引入非线性(ReLU 最常用)
  • 反向传播通过链式法则更新权重

今天我们将理解"深度"的意义。

---

核心内容

一、为什么需要"深度"?

万能近似定理:一个足够宽的浅层网络可以近似任何函数。

但实际问题

  • 浅层网络需要指数级增长的神经元
  • 深层网络可以用更少的参数表达同样的函数

💡 类比:用乐高积木搭埃菲尔铁塔。一层层往上搭(深度),比直接用一个巨大的块(宽度)更高效、更稳定。

二、层次化特征学习

深度网络的核心优势:逐层提取特征

以图像识别为例: `` 第1层(浅层):检测边缘、颜色 第2-3层(中层):检测纹理、简单形状 第4-5层(深层):检测物体部件(眼睛、轮子) 第6层+(更深层):识别完整物体(猫、车、人脸) ``

💡 类比:就像人类看画。先看颜色(浅层),再看形状(中层),最后理解画面内容(深层)。

三、深度学习的核心优势

优势说明
自动特征提取不需要人工设计特征
端到端学习原始数据直接到预测结果
迁移学习预训练模型可以迁移到新任务
可扩展性数据越多、模型越大,效果越好

四、深度 vs 宽度的权衡

维度深度网络宽度网络
参数量更少(更高效)更多
训练难度更难(梯度消失)较易
表达能力层次化,更强扁平化
典型代表ResNet(152层)浅层 MLP

---

思考题

如果给你 1000 万个参数,你会选择建一个"很宽但很浅"的网络,还是"很窄但很深"的网络?为什么?

---

延伸阅读
  1. 📄 论文:ImageNet Classification with Deep CNN(AlexNet)

👉 https://arxiv.org/abs/1409.1556

---

GitHub 推荐

pytorch/pytorch — Facebook 深度学习框架

  • 🔗 链接:https://github.com/pytorch/pytorch
  • 📊 Stars:85,000+

一句话介绍:研究界最流行的深度学习框架,动态计算图,调试友好。

---

📌 课程进度:Day 6 / 90 | 模块1:AI世界观

🎓 明天预告Day 7 什么是大语言模型(LLM) —— GPT、Claude、Kimi 的底层原理!

---

DAY 7 / 90

什么是大语言模型(LLM)

学习目标

理解大语言模型的本质、训练方式和核心能力。

---

昨日回顾

Day 6:深度学习的力量

昨天我们理解了"深度"的意义:

  • 深层网络可以用更少的参数表达复杂函数
  • 层次化特征学习:从边缘 → 形状 → 物体
  • 深度学习的核心优势:自动特征提取、端到端学习

今天我们将进入大语言模型的世界。

---

核心内容

一、什么是大语言模型?

大语言模型(Large Language Model,LLM)是参数量巨大(数十亿到数千亿)的神经网络,专门训练来理解和生成自然语言。

核心思想:通过阅读海量文本,学习语言的统计规律,从而能够:

  • 回答问题
  • 写文章
  • 翻译语言
  • 写代码
  • 推理分析

💡 类比:就像一个读了全人类所有书籍的人,虽然没有"理解",但掌握了语言的规律模式。

二、LLM 的训练过程

预训练(Pre-training)
  → 在大规模无标注文本上训练
  → 学习语言的通用规律
  → 成本高(数百万美元)

微调(Fine-tuning)
  → 在特定任务数据上进一步训练
  → 让模型适应具体场景
  → 成本较低

对齐(Alignment)
  → RLHF:人类反馈强化学习
  → 让模型输出符合人类偏好
  → 更安全、更有用

三、LLM 的核心能力

能力描述示例
生成根据提示生成文本写文章、写诗
理解理解文本含义摘要、分类
推理逻辑推理和计算数学问题、代码调试
知识存储大量事实回答历史、科学问题
翻译跨语言转换中英文互译

四、LLM 的局限性

  • 幻觉(Hallucination):可能一本正经地胡说八道
  • 知识截止:不知道训练之后发生的事
  • 缺乏真正的理解:只是模式匹配,不是真正"懂"
  • 计算成本高:推理一次需要大量算力

---

思考题

LLM 能写出流畅的英文文章,但它"理解"自己写的内容吗?如果它写的文章里有个事实错误,它自己能发现吗?

---

延伸阅读
  1. 📄 GPT-3 论文:Language Models are Few-Shot Learners

👉 https://arxiv.org/abs/2005.14165

---

GitHub 推荐

huggingface/transformers — 预训练模型库

  • 🔗 链接:https://github.com/huggingface/transformers
  • 📊 Stars:130,000+

一句话介绍:Hugging Face 的 Transformers 库,加载和使用各种预训练模型只需几行代码。

---

📌 课程进度:Day 7 / 90 | 模块1:AI世界观

🎓 明天预告Day 8 GPT系列演进 —— 从GPT-1到GPT-4的能力跃迁!

---

DAY 8 / 90

GPT系列演进

学习目标

了解 GPT 系列模型的演进历程,理解规模带来的能力跃迁。

---

昨日回顾

Day 7:什么是大语言模型(LLM)

昨天我们掌握了 LLM 的核心概念:

  • LLM 是参数量巨大的神经网络,专门处理自然语言
  • 训练三阶段:预训练 → 微调 → 对齐(RLHF)
  • 核心能力:生成、理解、推理、翻译
  • 局限性:幻觉、知识截止、缺乏真正理解

今天我们将沿着 GPT 的演进时间线,看规模如何带来能力跃迁。

---

核心内容

一、GPT-1(2018):预训练 + 微调的范式

  • 参数量:1.17 亿
  • 核心创新:无监督预训练 + 有监督微调
  • 效果:在多个 NLP 任务上达到 SOTA

二、GPT-2(2019):更大的模型,涌现能力

  • 参数量:15 亿
  • 核心发现:模型变大后,零样本(Zero-shot)能力出现
  • 发布策略:OpenAI 认为太危险,先只发布小版本

三、GPT-3(2020):规模带来质变

  • 参数量:1750 亿
  • 核心突破:上下文学习(In-Context Learning)

- 不需要微调,给几个例子就能学会新任务

  • 应用:写文章、代码、对话、翻译

四、GPT-3.5 / ChatGPT(2022):对齐的魔力

  • 核心创新:RLHF(人类反馈强化学习)
  • 效果:对话更自然、更安全、更有用
  • 影响:引爆了生成式 AI 的大众化

五、GPT-4(2023):多模态 + 推理

  • 能力:文本 + 图像理解
  • 推理:在复杂任务上显著优于 GPT-3.5
  • 安全性:更不容易被越狱

六、规模与能力的非线性关系

模型规模(参数)
    ↑
    │              ★ GPT-3 涌现
    │           /
    │        /
    │      /
    │    /
    │  /
    │/
    └────────────────→ 能力

💡 涌现能力:当模型规模达到某个阈值,会突然出现小模型完全没有的能力。

---

思考题

GPT-3 比 GPT-2 大了 100 多倍,能力提升是线性的还是跳跃式的?涌现能力对 AI 发展意味着什么?

---

延伸阅读
  1. 📄 Scaling Laws for Neural Language Models

👉 https://arxiv.org/abs/2001.08361

---

GitHub 推荐

openai/openai-python — OpenAI 官方 Python SDK

  • 🔗 链接:https://github.com/openai/openai-python
  • 📊 Stars:25,000+

---

📌 课程进度:Day 8 / 90 | 模块1:AI世界观

🎓 明天预告Day 9 Transformer架构 —— 注意力机制的革命!

---

DAY 9 / 90

Transformer架构

学习目标

理解 Transformer 的核心思想——注意力机制,以及它为什么能取代 RNN。

---

昨日回顾

Day 8:GPT系列演进

昨天我们走过了 GPT 的演进:

  • GPT-1:预训练 + 微调范式
  • GPT-2:涌现零样本能力
  • GPT-3:上下文学习,175B 参数
  • GPT-4:多模态 + 强推理

今天我们将深入 GPT 的底层架构——Transformer。

---

核心内容

一、为什么需要 Transformer?

RNN 的问题

  • 串行计算,无法并行 → 训练慢
  • 长距离依赖困难 → 记不住前面的内容

Transformer 的解决方案

  • 自注意力(Self-Attention):每个词可以同时"看"到所有其他词
  • 并行计算:所有位置同时处理

💡 类比:RNN 像一个人逐字读文章,读完后面的忘了前面的。Transformer 像一群人同时读,每个人都能看到全文,互相讨论。

二、自注意力机制

核心问题:对于句子中的每个词,哪些其他词对它最重要?

计算过程

  1. 每个词生成三个向量:Query(查询)、Key(键)、Value(值)
  2. 计算相似度:Query · Key = 注意力权重
  3. 加权求和:用权重对 Value 加权
# 简化的自注意力计算
attention_scores = Q @ K.T  # 计算相似度
attention_weights = softmax(attention_scores)  # 归一化
output = attention_weights @ V  # 加权求和

三、多头注意力(Multi-Head Attention)

核心思想:不只一种"关注方式",用多组 Q/K/V 并行计算。

💡 类比:就像看一幅画,有人关注色彩,有人关注构图,有人关注人物表情。多头注意力让模型同时从多个角度理解信息。

四、Transformer 整体架构

输入 → Embedding + 位置编码
    → [多头注意力 → 前馈网络] × N 层
    → 输出概率分布

关键组件

  • Encoder:双向理解(BERT 风格)
  • Decoder:单向生成(GPT 风格)
  • 位置编码:让模型知道词的顺序

---

思考题

Transformer 的自注意力机制计算复杂度是 O(n²)。如果输入长度从 1000 增加到 10000,计算量会增加多少倍?这给长文本处理带来什么挑战?

---

延伸阅读
  1. 📄 Attention Is All You Need(Transformer 原始论文)

👉 https://arxiv.org/abs/1706.03762

---

GitHub 推荐

karpathy/minGPT — 极简 GPT 实现

  • 🔗 链接:https://github.com/karpathy/minGPT
  • 📊 Stars:20,000+

一句话介绍:Andrej Karpathy 写的最简洁的 GPT 实现,300 行代码理解 Transformer。

---

📌 课程进度:Day 9 / 90 | 模块1:AI世界观

🎓 明天预告Day 10 大模型的能力边界 —— LLM 能做什么、不能做什么!

---

DAY 10 / 90

大模型的能力边界

学习目标

客观认识 LLM 的能力边界,知道什么时候该用 AI、什么时候不该用。

---

昨日回顾

Day 9:Transformer架构

昨天我们深入理解了 Transformer:

  • 自注意力机制:每个词同时"看"到所有其他词
  • 多头注意力:多角度理解信息
  • Transformer 取代 RNN 的核心原因:并行 + 长距离依赖

今天我们将客观评估 LLM 的能力边界。

---

核心内容

一、LLM 擅长什么?

任务类型示例可靠性
文本生成写文章、邮件、营销文案⭐⭐⭐⭐⭐
代码辅助写函数、解释代码、Debug⭐⭐⭐⭐
知识问答历史、科学、文化常识⭐⭐⭐⭐
翻译多语言翻译⭐⭐⭐⭐⭐
摘要长文摘要⭐⭐⭐⭐
头脑风暴创意点子、方案建议⭐⭐⭐⭐⭐

二、LLM 不擅长什么?

任务类型原因风险
精确计算训练目标不是计算可能算错
实时信息知识有截止日期信息过时
物理世界操作无法感知物理环境无法执行
长程复杂推理注意力机制限制中间步骤出错
道德判断没有真正的价值观可能给出有害建议

三、使用 LLM 的黄金法则

  1. 不要完全信任:对关键信息要二次验证
  2. 给足上下文:Prompt 越具体,输出越准确
  3. 分步骤处理:复杂任务拆成多步
  4. 人机协作:AI 辅助,人类决策
  5. 设置护栏:过滤敏感、危险内容

四、AI 的"Jevons 悖论"

当一项技术变得更高效时,它的总使用量反而会增加。

LLM 让内容生产更便宜 → 内容总量爆炸 → 人类注意力更稀缺 → 优质内容更有价值。

---

思考题

假设你是一家医院的管理者,你会用 LLM 来做什么?绝对不会让它做什么?为什么?

---

延伸阅读
  1. 📄 On the Dangers of Stochastic Parrots

👉 https://arxiv.org/abs/2108.07258

---

GitHub 推荐

microsoft/promptbase — Prompt 工程基准测试

  • 🔗 链接:https://github.com/microsoft/promptbase

一句话介绍:系统评估不同 Prompt 技术的效果。

---

📌 课程进度:Day 10 / 90 ✅ 模块1完成

🎓 下一步模块2:大模型核心原理 —— Tokenization、注意力、预训练、RLHF!

---

# 模块2:大模型核心原理(Day 11-25)

---

机器学习基础 →