什么是人工智能?
今天学完,你能清晰区分人工智能、机器学习和深度学习这三个常被混淆的概念,并理解弱人工智能和强人工智能的本质区别。
---
一、人工智能(AI)—— 大树的根基
人工智能(Artificial Intelligence,AI)是计算机科学的一个分支,目标是让机器模拟人类智能。这里的"智能"包括:理解语言、识别图像、推理决策、学习经验等。
💡 类比:想象你教一个孩子认识世界。AI 就像那个"被教导的孩子"——通过某种方式获得"知识"和"能力"。
AI 可以分为两大类:
- 弱人工智能(Narrow AI):专门解决特定任务,比如下棋、识别猫狗、语音助手。这是当前我们所见的一切 AI。AlphaGo、ChatGPT、Siri 都属于弱 AI。
- 强人工智能(General AI / AGI):具有与人类相当或超越人类的通用智能,可以像人一样思考、学习、解决各种新问题。目前尚未实现,这是科幻和研究的终极目标。
⚠️ 注意:很多人误以为 ChatGPT 已经"有思想"了,其实它只是极其复杂的模式匹配工具,离真正的 AGI 还有很远。
二、机器学习(Machine Learning)—— 让机器自学的方法
机器学习是实现 AI 的核心方法之一。传统编程是"人写规则,机器执行";机器学习则是"人给数据,机器自己发现规则"。
💡 类比:传统编程就像你给女儿写一本《如何识别苹果》的说明书(圆圆的、红色的、有柄)。机器学习则是你给她看成千上万张苹果照片,她自己总结出"苹果长什么样"。
机器学习有三种主要学习方式:
- 监督学习:有"标准答案"的学习。比如给机器看很多标注了"猫"或"狗"的照片,让它学会分类。
- 无监督学习:没有标准答案,让机器自己发现数据中的规律。比如把客户按购买行为自动分成不同群体。
- 强化学习:通过试错和奖励来学习。比如训练机器玩游戏,得分高就"奖励",让它逐渐找到最优策略。
三、深度学习(Deep Learning)—— 机器学习的"升级版"
深度学习是机器学习的一个子集,它使用多层神经网络(Neural Networks)来自动提取数据的特征。
💡 类比:机器学习像一个学生,需要老师(人类)告诉他"看颜色、看形状、看纹理"来识别苹果。深度学习则像一个更聪明的学生,老师只给照片,他自己决定该看哪些特征——而且可能发现人类都注意不到的微妙特征(比如苹果表面反光的方式)。
深度学习的关键是神经网络,它模拟了人脑神经元的工作方式。一个"深度"神经网络通常有几十层甚至上百层,每一层都在提取不同级别的特征:
- 第一层:识别边缘、颜色
- 中间层:识别形状、纹理
- 深层:识别复杂物体(如猫的脸、车的轮廓)
三者的关系总结: `` 人工智能(AI)—— 最广泛的目标 └── 机器学习(ML)—— 实现 AI 的主要方法 └── 深度学习(DL)—— ML 中最强大的技术 ``
---
- 人工智能(AI):让机器模拟人类智能的科学与技术。
- 机器学习(ML):AI 的子领域,让机器从数据中学习规律。
- 深度学习(DL):ML 的子领域,使用深层神经网络自动学习特征。
- 神经网络(Neural Network):模拟人脑神经元连接的计算模型。
- 弱 AI vs 强 AI:弱 AI 专精一个任务;强 AI 具有通用智能,目前只存在于理论中。
---
案例1:你手机里的 AI
- 当你用面容解锁 iPhone 时,深度学习在分析你面部特征的三维结构。
- 当你拍照片,手机自动识别出"人物""风景""美食"时,这是机器学习在分类。
- 当你说"嘿 Siri,明天8点叫我起床",Siri 理解你的语言并设置闹钟,这是自然语言处理(NLP),一种 AI 应用。
案例2:推荐系统
- 抖音刷视频、淘宝猜你喜欢、网易云每日推荐——背后都是机器学习在分析你的历史行为,预测你可能喜欢的内容。
---
ChatGPT 能写诗、能写代码、能和你聊天,它是不是"强人工智能"?为什么?
---
- 📺 3Blue1Brown - Neural Networks:用最直观的动画讲解神经网络
👉 https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_67000Dx_ZCJB-3pi
- 🎓 MIT Introduction to Deep Learning:MIT 公开课
👉 https://www.youtube.com/playlist?list=PLtBw6njQRU-rwp5__7Cvo4U4GMsyWnExO
---
microsoft/ML-For-Beginners — 微软官方的机器学习入门课程
- 🔗 链接:https://github.com/microsoft/ML-For-Beginners
- 📊 Stars:68,000+ | 📝 Jupyter Notebook / Python
一句话介绍:12 周、26 节课、52 个测验的免费机器学习课程,专为零基础设计,有完整中文翻译。
---
📌 课程进度:Day 1 / 90 | 模块1:AI世界观
🎓 明天预告:Day 2 AI发展简史 —— 从图灵测试到ChatGPT,三次AI浪潮!
---
AI发展简史
了解 AI 发展的三次浪潮与关键里程碑,理解每个阶段的核心技术和局限性。
---
Day 1:什么是人工智能?
昨天我们建立了 AI 的宏观认知框架:
- AI 是让机器模拟人类智能的总目标
- 机器学习(ML) 是实现 AI 的核心方法
- 深度学习(DL) 是 ML 中最强大的技术
- 当前所有 AI(包括 ChatGPT)都是弱 AI
今天我们将沿着时间线,看看 AI 是如何一步步发展到今天的。
---
一、第一次浪潮:符号主义时代(1950s-1980s)
核心理念:智能 = 符号操作。如果能把人类的知识用符号和规则表示出来,机器就能推理。
关键事件:
- 1950:图灵测试提出
- 1956:达特茅斯会议——"人工智能"一词正式诞生
- 1960s-1970s:专家系统(Expert Systems)兴起
- MYCIN:医疗诊断系统
- DENDRAL:化学分析系统
为什么会衰落?
- 知识获取瓶颈:专家的知识很难被提取成规则
- 常识问题:人类常识无法穷举
- 计算能力有限
二、第二次浪潮:统计学习时代(1980s-2010s)
核心理念:不要教机器规则,让机器从数据中学习统计规律。
关键技术:
- 1980s:神经网络复兴(反向传播算法)
- 1990s:支持向量机(SVM)、随机森林
- 2012:AlexNet——深度学习的历史性突破
三、第三次浪潮:深度学习时代(2012-至今)
核心理念:数据 + 算力 + 算法 = 智能。
里程碑时间线:
| 年份 | 事件 | 意义 |
|---|---|---|
| 2012 | AlexNet | 深度学习复兴 |
| 2014 | GAN 提出 | 生成模型新时代 |
| 2016 | AlphaGo 击败李世石 | AI 超越人类顶尖棋手 |
| 2017 | Transformer 论文 | 注意力机制革命 |
| 2018 | BERT | 预训练模型元年 |
| 2020 | GPT-3 | 上下文学习涌现 |
| 2022 | ChatGPT | AI 大众化元年 |
| 2023 | GPT-4 | 多模态 + 推理 |
| 2024 | Sora | 视频生成突破 |
| 2025-2026 | Agent/Reasoning 爆发 | AI 从聊天到行动 |
四、当前阶段:大模型 + Agent 时代
- 大语言模型(LLM) 成为通用接口
- Prompt Engineering 成为新技能
- AI Agent 让模型能调用工具、自主行动
- 多模态 让 AI 能看、能听、能读
---
- 图灵测试(Turing Test):如果人类无法区分对话对象是机器还是人
- 达特茅斯会议(1956):AI 作为学科的诞生地
- 专家系统:基于规则的知识库系统
- ImageNet 时刻:2012 年 AlexNet 的突破
---
案例:AlphaGo 的三次进化
| 版本 | 年份 | 技术 | 战绩 |
|---|---|---|---|
| AlphaGo | 2016 | 深度学习 + 蒙特卡洛树搜索 | 4:1 击败李世石 |
| AlphaGo Zero | 2017 | 纯强化学习 | 100:0 击败 AlphaGo |
| AlphaZero | 2018 | 通用算法 | 统一超越人类 |
AlphaGo Zero 的意义:证明了 AI 可以在没有人类知识的情况下,通过自我对弈达到超人类水平。
---
第一次 AI 浪潮(符号主义)和第三次浪潮(深度学习)的根本区别是什么?为什么符号主义失败了,而深度学习成功了?
---
- 📺 AlphaGo 纪录片:Netflix 出品
👉 https://www.netflix.com/title/80190844
- 📄 Attention Is All You Need(Transformer 原始论文)
👉 https://arxiv.org/abs/1706.03762
---
google-research/google-research — Google 研究团队官方代码仓库
- 🔗 链接:https://github.com/google-research/google-research
- 📊 Stars:35,000+
为什么推荐:包含 Transformer、BERT、T5 等里程碑工作的原始实现。
---
📌 课程进度:Day 2 / 90 | 模块1:AI世界观
🎓 明天预告:Day 3 机器学习的核心思想 —— 训练数据、模型、预测的全流程!
---
机器学习的核心思想
理解"让机器从数据中学习"的本质,掌握训练数据、模型、预测的核心流程。
---
Day 2:AI发展简史
昨天我们走过了 AI 的三次浪潮:
- 第一次:符号主义,用规则模拟智能
- 第二次:统计学习,AlexNet 开启深度学习
- 第三次:深度学习 + 大模型,数据 + 算力 + 算法的爆发
关键启示:AI 的进步往往来自数据、算力、算法三者的协同突破。
---
一、机器学习的本质
传统编程: `` 人写规则 → 机器执行 → 得到结果 ``
机器学习: `` 人给数据(输入 + 输出)→ 机器发现规则 → 用规则预测新数据 ``
💡 类比:传统编程就像你给学生一本《数学公式手册》。机器学习就像你给学生 1000 道数学题和答案,让他自己总结规律。
二、核心三要素
| 要素 | 说明 | 类比 |
|---|---|---|
| 数据(Data) | 学习的原材料 | 教科书和习题 |
| 模型(Model) | 学习到的规律 | 学生总结的知识体系 |
| 算法(Algorithm) | 学习的方法 | 学生用的学习策略 |
三、学习范式概览
机器学习
├── 监督学习(Supervised Learning)
│ ├── 分类(Classification):预测类别
│ └── 回归(Regression):预测数值
├── 无监督学习(Unsupervised Learning)
│ ├── 聚类(Clustering):发现数据分组
│ └── 降维(Dimensionality Reduction):简化数据
└── 强化学习(Reinforcement Learning)
└── 策略学习:学习最优行动策略
四、训练流程
1. 数据收集 → 2. 数据预处理 → 3. 特征工程
↓
4. 选择模型 → 5. 训练(拟合数据)→ 6. 评估
↓
7. 调优 → 8. 部署 → 9. 监控与迭代
⚠️ 常见误区:很多人以为机器学习就是"丢数据进去,模型自己变聪明"。实际上,数据质量、特征设计、模型选择每一步都需要人的智慧和经验。
---
- 训练数据(Training Data):用于训练模型的数据
- 测试数据(Test Data):用于评估模型性能的数据
- 特征(Feature):描述数据的属性/变量
- 标签(Label):数据的期望输出
- 泛化(Generalization):模型对未见过数据的预测能力
---
案例:垃圾邮件过滤器
传统编程方式:
- 人写规则:如果邮件包含"免费""中奖"→ 垃圾邮件
- 问题:垃圾邮件发送者会不断变换话术
机器学习方式:
- 收集 10 万封邮件,人工标注"垃圾"或"正常"
- 模型学习:哪些词汇组合对应垃圾邮件
- 自动适应:新类型出现,只需重新训练
💡 关键洞察:机器学习让系统能自动适应变化。
---
假设你要用机器学习预测明天会不会下雨,你需要什么数据?这些数据属于"特征"还是"标签"?
---
- 📖 Google 机器学习速成课程
👉 https://developers.google.com/machine-learning/crash-course
- 📺 吴恩达机器学习课程
👉 https://www.coursera.org/learn/machine-learning
---
ScrapeGraphAI/Scrapegraph-ai — 基于 AI 的 Python 爬虫框架
- 🔗 链接:https://github.com/ScrapeGraphAI/Scrapegraph-ai
- 📊 Stars:18,000+
一句话介绍:使用 LLM 自动提取网页数据,无需编写 XPath。
---
📌 课程进度:Day 3 / 90 | 模块1:AI世界观
🎓 明天预告:Day 4 监督/无监督/强化学习 —— 三种学习范式的深入对比!
---
监督/无监督/强化学习
深入理解三种学习范式的区别、适用场景和经典算法。
---
Day 3:机器学习的核心思想
昨天我们掌握了 ML 的本质:
- 传统编程:人写规则 → 机器执行
- 机器学习:人给数据 → 机器发现规则 → 预测新数据
- 三要素:数据、模型、算法
- 训练流程:收集 → 预处理 → 训练 → 评估 → 部署
今天我们将深入三种学习范式。
---
一、监督学习(Supervised Learning)
定义:用标注好的数据训练模型,模型学习"输入 → 输出"的映射。
两大任务:
- 分类(Classification):预测离散类别
- 例:邮件是垃圾/正常、图片是猫/狗
- 回归(Regression):预测连续数值
- 例:房价、股价、温度
经典算法:
- 线性回归、逻辑回归
- 决策树、随机森林
- 支持向量机(SVM)
- 神经网络
二、无监督学习(Unsupervised Learning)
定义:没有标注数据,让模型自己发现数据中的结构和规律。
主要任务:
- 聚类(Clustering):把相似数据分到一组
- 例:客户分群、文档分类
- 降维(Dimensionality Reduction):减少数据维度
- 例:数据可视化、特征压缩
- 关联规则:发现数据间的关联
- 例:购物篮分析(买啤酒的人也买尿布)
经典算法:
- K-Means 聚类
- 层次聚类
- PCA(主成分分析)
- 自编码器
三、强化学习(Reinforcement Learning)
定义:智能体(Agent)在环境中通过试错学习,目标是最大化累积奖励。
核心概念:
- Agent:做决策的主体
- Environment:Agent 所处的世界
- State:当前状态
- Action:Agent 可以采取的行动
- Reward:采取行动后获得的反馈
💡 类比:就像训练小狗。做对了给零食(正奖励),做错了不给(负奖励),小狗逐渐学会正确的行为。
经典算法:
- Q-Learning
- 策略梯度(Policy Gradient)
- PPO(Proximal Policy Optimization)
- DQN(Deep Q-Network)
四、三种范式的对比
| 维度 | 监督学习 | 无监督学习 | 强化学习 |
|---|---|---|---|
| 数据 | 有标注 | 无标注 | 无标注,有奖励 |
| 目标 | 预测标签 | 发现结构 | 最大化奖励 |
| 反馈 | 即时 | 无 | 延迟 |
| 典型应用 | 分类、回归 | 聚类、降维 | 游戏、机器人 |
---
自动驾驶汽车的学习应该属于哪种范式?为什么?(提示:它需要人类驾驶员的示范数据吗?还是需要自己在模拟环境中试错?)
---
- 📺 DeepMind 强化学习系列
👉 https://www.youtube.com/watch?v=2pWv7GOvuf0
---
openai/gym — 强化学习环境标准库
- 🔗 链接:https://github.com/openai/gym
- 📊 Stars:35,000+
一句话介绍:标准化的强化学习环境,让研究者可以比较不同算法的表现。
---
📌 课程进度:Day 4 / 90 | 模块1:AI世界观
🎓 明天预告:Day 5 神经网络基础 —— 从感知机到多层网络!
---
神经网络基础
理解神经网络的基本结构和工作原理,从感知机到多层网络。
---
Day 4:监督/无监督/强化学习
昨天我们深入对比了三种学习范式:
- 监督学习:有标注数据,学习输入→输出映射
- 无监督学习:无标注,自己发现结构
- 强化学习:通过奖励信号学习最优策略
今天我们将进入深度学习的基础——神经网络。
---
一、感知机(Perceptron)—— 神经网络的起源
感知机是最简单的神经网络,只有一个神经元。
输入 x₁, x₂, ..., xₙ → 加权求和 → 激活函数 → 输出
数学表示: `` output = f(w₁x₁ + w₂x₂ + ... + wₙxₙ + b) ``
其中 f 是激活函数,w 是权重,b 是偏置。
💡 类比:感知机就像一个投票器。每个输入给一个"票数"(权重),超过阈值就输出 1,否则输出 0。
二、多层感知机(MLP)
把多个感知机层叠起来:
输入层 → 隐藏层 → 隐藏层 → 输出层
- 输入层:接收原始数据
- 隐藏层:提取特征(可以有多个)
- 输出层:给出预测结果
💡 关键洞察:隐藏层的存在让网络可以学习非线性关系。没有隐藏层,感知机只能解决线性可分问题。
三、激活函数
激活函数给神经网络引入非线性,让它能学习复杂的模式。
| 激活函数 | 公式 | 特点 |
|---|---|---|
| Sigmoid | 1/(1+e⁻ˣ) | 输出 0-1,适合做概率 |
| ReLU | max(0, x) | 计算快,最常用 |
| Tanh | (eˣ-e⁻ˣ)/(eˣ+e⁻ˣ) | 输出 -1 到 1 |
| Softmax | eˣⁱ/Σeˣʲ | 多分类输出概率 |
四、前向传播与反向传播
- 前向传播(Forward Propagation):数据从输入层流到输出层,计算预测结果
- 反向传播(Backpropagation):从输出层往回传误差,更新权重
💡 类比:前向传播就像考试交卷,反向传播就像老师批改后告诉你哪里错了,你回去改正。
---
- 感知机(Perceptron):最简单的神经网络单元
- 权重(Weight):连接强度,决定输入的重要性
- 偏置(Bias):阈值调整,决定神经元多容易激活
- 激活函数(Activation Function):引入非线性
- 反向传播(Backpropagation):通过链式法则更新权重
---
案例:手写数字识别(MNIST)
- 输入:28×28 像素的灰度图(784 维向量)
- 隐藏层:128 个神经元
- 输出层:10 个神经元(对应 0-9)
- 激活函数:隐藏层 ReLU,输出层 Softmax
---
如果没有激活函数(或者只用线性激活函数),多层神经网络和单层感知机有什么区别?
---
- 📺 3Blue1Brown - 神经网络系列
👉 https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_67000Dx_ZCJB-3pi
---
tensorflow/tensorflow — Google 深度学习框架
- 🔗 链接:https://github.com/tensorflow/tensorflow
- 📊 Stars:180,000+
一句话介绍:最主流的深度学习框架之一,生态丰富,工业界广泛应用。
---
📌 课程进度:Day 5 / 90 | 模块1:AI世界观
🎓 明天预告:Day 6 深度学习的力量 —— 为什么深度网络比浅层网络更强?
---
深度学习的力量
理解为什么深层网络比浅层网络更强,以及深度学习的核心优势。
---
Day 5:神经网络基础
昨天我们学了神经网络的基本结构:
- 感知机是最简单的神经元
- 多层感知机(MLP)通过隐藏层学习非线性关系
- 激活函数引入非线性(ReLU 最常用)
- 反向传播通过链式法则更新权重
今天我们将理解"深度"的意义。
---
一、为什么需要"深度"?
万能近似定理:一个足够宽的浅层网络可以近似任何函数。
但实际问题:
- 浅层网络需要指数级增长的神经元
- 深层网络可以用更少的参数表达同样的函数
💡 类比:用乐高积木搭埃菲尔铁塔。一层层往上搭(深度),比直接用一个巨大的块(宽度)更高效、更稳定。
二、层次化特征学习
深度网络的核心优势:逐层提取特征。
以图像识别为例: `` 第1层(浅层):检测边缘、颜色 第2-3层(中层):检测纹理、简单形状 第4-5层(深层):检测物体部件(眼睛、轮子) 第6层+(更深层):识别完整物体(猫、车、人脸) ``
💡 类比:就像人类看画。先看颜色(浅层),再看形状(中层),最后理解画面内容(深层)。
三、深度学习的核心优势
| 优势 | 说明 |
|---|---|
| 自动特征提取 | 不需要人工设计特征 |
| 端到端学习 | 原始数据直接到预测结果 |
| 迁移学习 | 预训练模型可以迁移到新任务 |
| 可扩展性 | 数据越多、模型越大,效果越好 |
四、深度 vs 宽度的权衡
| 维度 | 深度网络 | 宽度网络 |
|---|---|---|
| 参数量 | 更少(更高效) | 更多 |
| 训练难度 | 更难(梯度消失) | 较易 |
| 表达能力 | 层次化,更强 | 扁平化 |
| 典型代表 | ResNet(152层) | 浅层 MLP |
---
如果给你 1000 万个参数,你会选择建一个"很宽但很浅"的网络,还是"很窄但很深"的网络?为什么?
---
- 📄 论文:ImageNet Classification with Deep CNN(AlexNet)
👉 https://arxiv.org/abs/1409.1556
---
pytorch/pytorch — Facebook 深度学习框架
- 🔗 链接:https://github.com/pytorch/pytorch
- 📊 Stars:85,000+
一句话介绍:研究界最流行的深度学习框架,动态计算图,调试友好。
---
📌 课程进度:Day 6 / 90 | 模块1:AI世界观
🎓 明天预告:Day 7 什么是大语言模型(LLM) —— GPT、Claude、Kimi 的底层原理!
---
什么是大语言模型(LLM)
理解大语言模型的本质、训练方式和核心能力。
---
Day 6:深度学习的力量
昨天我们理解了"深度"的意义:
- 深层网络可以用更少的参数表达复杂函数
- 层次化特征学习:从边缘 → 形状 → 物体
- 深度学习的核心优势:自动特征提取、端到端学习
今天我们将进入大语言模型的世界。
---
一、什么是大语言模型?
大语言模型(Large Language Model,LLM)是参数量巨大(数十亿到数千亿)的神经网络,专门训练来理解和生成自然语言。
核心思想:通过阅读海量文本,学习语言的统计规律,从而能够:
- 回答问题
- 写文章
- 翻译语言
- 写代码
- 推理分析
💡 类比:就像一个读了全人类所有书籍的人,虽然没有"理解",但掌握了语言的规律模式。
二、LLM 的训练过程
预训练(Pre-training)
→ 在大规模无标注文本上训练
→ 学习语言的通用规律
→ 成本高(数百万美元)
微调(Fine-tuning)
→ 在特定任务数据上进一步训练
→ 让模型适应具体场景
→ 成本较低
对齐(Alignment)
→ RLHF:人类反馈强化学习
→ 让模型输出符合人类偏好
→ 更安全、更有用
三、LLM 的核心能力
| 能力 | 描述 | 示例 |
|---|---|---|
| 生成 | 根据提示生成文本 | 写文章、写诗 |
| 理解 | 理解文本含义 | 摘要、分类 |
| 推理 | 逻辑推理和计算 | 数学问题、代码调试 |
| 知识 | 存储大量事实 | 回答历史、科学问题 |
| 翻译 | 跨语言转换 | 中英文互译 |
四、LLM 的局限性
- 幻觉(Hallucination):可能一本正经地胡说八道
- 知识截止:不知道训练之后发生的事
- 缺乏真正的理解:只是模式匹配,不是真正"懂"
- 计算成本高:推理一次需要大量算力
---
LLM 能写出流畅的英文文章,但它"理解"自己写的内容吗?如果它写的文章里有个事实错误,它自己能发现吗?
---
- 📄 GPT-3 论文:Language Models are Few-Shot Learners
👉 https://arxiv.org/abs/2005.14165
---
huggingface/transformers — 预训练模型库
- 🔗 链接:https://github.com/huggingface/transformers
- 📊 Stars:130,000+
一句话介绍:Hugging Face 的 Transformers 库,加载和使用各种预训练模型只需几行代码。
---
📌 课程进度:Day 7 / 90 | 模块1:AI世界观
🎓 明天预告:Day 8 GPT系列演进 —— 从GPT-1到GPT-4的能力跃迁!
---
GPT系列演进
了解 GPT 系列模型的演进历程,理解规模带来的能力跃迁。
---
Day 7:什么是大语言模型(LLM)
昨天我们掌握了 LLM 的核心概念:
- LLM 是参数量巨大的神经网络,专门处理自然语言
- 训练三阶段:预训练 → 微调 → 对齐(RLHF)
- 核心能力:生成、理解、推理、翻译
- 局限性:幻觉、知识截止、缺乏真正理解
今天我们将沿着 GPT 的演进时间线,看规模如何带来能力跃迁。
---
一、GPT-1(2018):预训练 + 微调的范式
- 参数量:1.17 亿
- 核心创新:无监督预训练 + 有监督微调
- 效果:在多个 NLP 任务上达到 SOTA
二、GPT-2(2019):更大的模型,涌现能力
- 参数量:15 亿
- 核心发现:模型变大后,零样本(Zero-shot)能力出现
- 发布策略:OpenAI 认为太危险,先只发布小版本
三、GPT-3(2020):规模带来质变
- 参数量:1750 亿
- 核心突破:上下文学习(In-Context Learning)
- 不需要微调,给几个例子就能学会新任务
- 应用:写文章、代码、对话、翻译
四、GPT-3.5 / ChatGPT(2022):对齐的魔力
- 核心创新:RLHF(人类反馈强化学习)
- 效果:对话更自然、更安全、更有用
- 影响:引爆了生成式 AI 的大众化
五、GPT-4(2023):多模态 + 推理
- 能力:文本 + 图像理解
- 推理:在复杂任务上显著优于 GPT-3.5
- 安全性:更不容易被越狱
六、规模与能力的非线性关系
模型规模(参数)
↑
│ ★ GPT-3 涌现
│ /
│ /
│ /
│ /
│ /
│/
└────────────────→ 能力
💡 涌现能力:当模型规模达到某个阈值,会突然出现小模型完全没有的能力。
---
GPT-3 比 GPT-2 大了 100 多倍,能力提升是线性的还是跳跃式的?涌现能力对 AI 发展意味着什么?
---
- 📄 Scaling Laws for Neural Language Models
👉 https://arxiv.org/abs/2001.08361
---
openai/openai-python — OpenAI 官方 Python SDK
- 🔗 链接:https://github.com/openai/openai-python
- 📊 Stars:25,000+
---
📌 课程进度:Day 8 / 90 | 模块1:AI世界观
🎓 明天预告:Day 9 Transformer架构 —— 注意力机制的革命!
---
Transformer架构
理解 Transformer 的核心思想——注意力机制,以及它为什么能取代 RNN。
---
Day 8:GPT系列演进
昨天我们走过了 GPT 的演进:
- GPT-1:预训练 + 微调范式
- GPT-2:涌现零样本能力
- GPT-3:上下文学习,175B 参数
- GPT-4:多模态 + 强推理
今天我们将深入 GPT 的底层架构——Transformer。
---
一、为什么需要 Transformer?
RNN 的问题:
- 串行计算,无法并行 → 训练慢
- 长距离依赖困难 → 记不住前面的内容
Transformer 的解决方案:
- 自注意力(Self-Attention):每个词可以同时"看"到所有其他词
- 并行计算:所有位置同时处理
💡 类比:RNN 像一个人逐字读文章,读完后面的忘了前面的。Transformer 像一群人同时读,每个人都能看到全文,互相讨论。
二、自注意力机制
核心问题:对于句子中的每个词,哪些其他词对它最重要?
计算过程:
- 每个词生成三个向量:Query(查询)、Key(键)、Value(值)
- 计算相似度:Query · Key = 注意力权重
- 加权求和:用权重对 Value 加权
# 简化的自注意力计算
attention_scores = Q @ K.T # 计算相似度
attention_weights = softmax(attention_scores) # 归一化
output = attention_weights @ V # 加权求和
三、多头注意力(Multi-Head Attention)
核心思想:不只一种"关注方式",用多组 Q/K/V 并行计算。
💡 类比:就像看一幅画,有人关注色彩,有人关注构图,有人关注人物表情。多头注意力让模型同时从多个角度理解信息。
四、Transformer 整体架构
输入 → Embedding + 位置编码
→ [多头注意力 → 前馈网络] × N 层
→ 输出概率分布
关键组件:
- Encoder:双向理解(BERT 风格)
- Decoder:单向生成(GPT 风格)
- 位置编码:让模型知道词的顺序
---
Transformer 的自注意力机制计算复杂度是 O(n²)。如果输入长度从 1000 增加到 10000,计算量会增加多少倍?这给长文本处理带来什么挑战?
---
- 📄 Attention Is All You Need(Transformer 原始论文)
👉 https://arxiv.org/abs/1706.03762
---
karpathy/minGPT — 极简 GPT 实现
- 🔗 链接:https://github.com/karpathy/minGPT
- 📊 Stars:20,000+
一句话介绍:Andrej Karpathy 写的最简洁的 GPT 实现,300 行代码理解 Transformer。
---
📌 课程进度:Day 9 / 90 | 模块1:AI世界观
🎓 明天预告:Day 10 大模型的能力边界 —— LLM 能做什么、不能做什么!
---
大模型的能力边界
客观认识 LLM 的能力边界,知道什么时候该用 AI、什么时候不该用。
---
Day 9:Transformer架构
昨天我们深入理解了 Transformer:
- 自注意力机制:每个词同时"看"到所有其他词
- 多头注意力:多角度理解信息
- Transformer 取代 RNN 的核心原因:并行 + 长距离依赖
今天我们将客观评估 LLM 的能力边界。
---
一、LLM 擅长什么?
| 任务类型 | 示例 | 可靠性 |
|---|---|---|
| 文本生成 | 写文章、邮件、营销文案 | ⭐⭐⭐⭐⭐ |
| 代码辅助 | 写函数、解释代码、Debug | ⭐⭐⭐⭐ |
| 知识问答 | 历史、科学、文化常识 | ⭐⭐⭐⭐ |
| 翻译 | 多语言翻译 | ⭐⭐⭐⭐⭐ |
| 摘要 | 长文摘要 | ⭐⭐⭐⭐ |
| 头脑风暴 | 创意点子、方案建议 | ⭐⭐⭐⭐⭐ |
二、LLM 不擅长什么?
| 任务类型 | 原因 | 风险 |
|---|---|---|
| 精确计算 | 训练目标不是计算 | 可能算错 |
| 实时信息 | 知识有截止日期 | 信息过时 |
| 物理世界操作 | 无法感知物理环境 | 无法执行 |
| 长程复杂推理 | 注意力机制限制 | 中间步骤出错 |
| 道德判断 | 没有真正的价值观 | 可能给出有害建议 |
三、使用 LLM 的黄金法则
- 不要完全信任:对关键信息要二次验证
- 给足上下文:Prompt 越具体,输出越准确
- 分步骤处理:复杂任务拆成多步
- 人机协作:AI 辅助,人类决策
- 设置护栏:过滤敏感、危险内容
四、AI 的"Jevons 悖论"
当一项技术变得更高效时,它的总使用量反而会增加。
LLM 让内容生产更便宜 → 内容总量爆炸 → 人类注意力更稀缺 → 优质内容更有价值。
---
假设你是一家医院的管理者,你会用 LLM 来做什么?绝对不会让它做什么?为什么?
---
- 📄 On the Dangers of Stochastic Parrots
👉 https://arxiv.org/abs/2108.07258
---
microsoft/promptbase — Prompt 工程基准测试
- 🔗 链接:https://github.com/microsoft/promptbase
一句话介绍:系统评估不同 Prompt 技术的效果。
---
📌 课程进度:Day 10 / 90 ✅ 模块1完成
🎓 下一步:模块2:大模型核心原理 —— Tokenization、注意力、预训练、RLHF!
---
# 模块2:大模型核心原理(Day 11-25)
---