人工智能与机器学习


个人理解:人工智能(AI)⊃ 机器学习(ML)⊃ 神经网络(NN)⊃ 深度学习(DL)≈ 深度神经网络。
深度学习基于深度神经网络;浅层与深层网络都属于神经网络;机器学习则涵盖神经网络在内的各类算法。
机器学习 > 神经网络 > 深度学习

一、核心概念总览
1. 人工智能(AI)
- 定义:模拟人类智能的计算机系统,涵盖感知、推理、学习、决策等能力。
- 范畴:最上层概念,包含机器学习、专家系统、计算机视觉等子领域。
- 目标:解决需要人类智能的任务(如自然语言处理、图像识别)。
2. 人工神经网络(ANN)
- 定义:受生物神经元启发的计算模型,由输入层、隐藏层、输出层构成。
- 数学本质:
- 单神经元:( y = f(w_1 x_1 + w_2 x_2 + \cdots + b) )(( f ) 为激活函数,如 ReLU)
- 网络训练:通过反向传播(Backpropagation)优化权重 ( w )
- 变体:卷积神经网络 CNN(空间特征)、循环神经网络 RNN(时序特征)、Transformer(自注意力机制)
神经网络在设计时模仿人脑处理方式。可大致分为单层、双层与多层网络。早期受限于层数难以加深、参数难调、样本不足等问题;2006 年 Hinton 提出「深度信念网络」,推动了深度学习的复兴。

参考:《神经网络浅讲:从神经元到深度学习》
3. 机器学习(ML)
- 定义:AI 的子领域,通过算法从数据中学习规律,无需显式编程。
- 核心思想:
- 数据驱动:模型性能依赖数据质量与数量
- 泛化能力:从训练数据推广到未知数据
- 典型方法:监督学习、无监督学习、半监督学习、强化学习等
4. 深度学习(DL)
- 定义:机器学习的分支,基于人工神经网络(ANN)的深层架构。
- 关键特征:
- 层次化特征提取:通过多层非线性变换自动学习数据表征(如 CNN 的卷积层)
- 端到端学习:无需手工设计特征(传统 ML 通常需要特征工程)
- 典型应用:图像分类(ResNet)、机器翻译(Transformer)
同机器学习一样,深度学习也有监督学习与无监督学习之分。例如,卷积神经网络(CNN)多为监督学习模型,深度置信网(DBN)则属于无监督学习模型。
5. 强化学习(RL)
- 定义:通过试错与环境交互学习最优策略,以最大化累积奖励。
- 核心要素:
- 智能体(Agent):决策主体
- 环境(Environment):智能体交互的对象
- 奖励函数(Reward):反馈信号
- 典型算法:Q-Learning、深度强化学习(DQN)等
6. 大语言模型(LLM)
- 定义:基于超大规模神经网络(如 GPT-4、PaLM)的生成式 AI 模型。
- 技术支柱:
- Transformer 架构:自注意力机制处理长程依赖
- 海量数据训练:千亿级 token 的语料库
- 提示工程(Prompting):通过自然语言指令控制输出
二、六者之间的层级关系
| 关系 | 说明 |
|---|---|
| AI ⊃ ML ⊃ DL | 深度学习是机器学习的子集,机器学习是 AI 的子集 |
| DL 依赖 ANN | 深度学习模型本质是多层神经网络(如 CNN、RNN、Transformer) |
| LLM 是 DL 的特例 | 大语言模型基于 Transformer 这一特殊 ANN 架构 |
| RL 与 DL 可交叉 | 深度强化学习(如 AlphaGo)结合了 DL 与 RL |

关键区别对比
| 维度 | 机器学习(ML) | 深度学习(DL) | 强化学习(RL) | 大语言模型(LLM) |
|---|---|---|---|---|
| 输入数据 | 结构化 / 特征工程 | 原始数据(图像 / 文本) | 环境状态(如游戏画面) | 海量文本(多为无标注) |
| 模型复杂度 | 相对简单(如 SVM) | 高(百万至千亿参数) | 中等(策略网络) | 极高(千亿参数级) |
| 训练方式 | 批量学习等 | 反向传播 + 梯度下降 | 试错 + 奖励反馈 | 自监督学习(如预测下文) |
| 人类干预 | 常需特征工程 | 端到端自动学习 | 需设计奖励函数 | 主要靠提示词(Prompt) |
| 典型应用 | 房价预测(线性回归) | 人脸识别(CNN) | 机器人控制(DQN) | ChatGPT 文本生成 |
技术演进逻辑
- 从规则到数据:早期 AI 依赖硬编码规则(专家系统),机器学习通过数据驱动突破限制。
- 从浅层到深层:传统 ML 受限于特征工程,DL 通过多层网络自动提取高阶特征。
- 从静态到交互:监督学习依赖标注数据,RL 通过与动态环境交互学习。
- 从单任务到通用:大语言模型通过预训练实现跨任务泛化(零样本 / 少样本学习)。
三、机器学习的学习范式
机器学习可按训练数据的「标签」情况与学习方式划分。

1. 监督学习(Supervised Learning)——「有标准答案」
数据既有特征(X),也有标签(Y)。目标是学习 ( X \rightarrow Y ) 的映射关系。
| 任务 | 说明 | 常见算法 |
|---|---|---|
| 回归 | 预测连续值 | 线性回归、多项式回归、岭回归 / Lasso、SVR、决策树回归、随机森林回归、XGBoost / LightGBM |
| 分类 | 预测离散类别 | 逻辑回归、KNN、朴素贝叶斯、SVM、决策树(ID3 / C4.5 / CART)、随机森林、GBDT、神经网络(CNN / RNN / Transformer) |
2. 无监督学习(Unsupervised Learning)——「没有标准答案」
只有特征(X),没有标签。目标是发现数据内在结构或规律。
| 任务 | 说明 | 常见算法 |
|---|---|---|
| 聚类 | 物以类聚 | K-Means、层次聚类、DBSCAN、高斯混合模型(GMM) |
| 降维 | 压缩特征 | PCA、LDA(带监督但常归于此)、t-SNE、自编码器(Autoencoder) |
| 关联规则 | 找捆绑关系 | Apriori、FP-Growth(如购物篮分析) |
3. 半监督学习(Semi-Supervised Learning)
介于监督与无监督之间:使用少量标注数据 + 大量未标注数据进行训练。常见于图像分类、文本分类等标注成本高的场景。
4. 强化学习(Reinforcement Learning)——「试错中学习」
智能体(Agent)通过与环境互动,根据奖励(Reward)反馈学习最佳策略。
| 类型 | 代表算法 |
|---|---|
| 基于价值 | Q-Learning、DQN |
| 基于策略 | Policy Gradient、PPO、A3C |
| 结合两者 | Actor-Critic |
延迟奖励(Delayed Reward)
强化学习中,当前动作的回报往往不会立刻出现,而是在若干步之后才体现(例如棋局中的一步棋,胜负要到终局才知道)。这种延迟奖励使信用分配(Credit Assignment)变得困难:模型需要判断「过去哪一步」真正导致了最终成败。常见应对思路包括:
- 使用折扣因子 ( \gamma ) 衡量远期奖励的重要性
- 价值函数 / 优势函数估计长期回报
- 资格迹(Eligibility Traces)等信用分配机制
5. 在线学习(Online Learning)
按学习方式还可区分:
| 方式 | 说明 | 例子 |
|---|---|---|
| 批量学习(Batch Learning) | 在整批数据上一次性训练,不实时更新 | SVM、线性回归等 |
| 在线学习(Online Learning) | 增量学习,随新数据到来不断更新模型 | 在线梯度下降、在线神经网络等 |
四、学习算法(Learning Algorithm)
在机器学习中,学习算法指机器从数据中「学习」,并据此进行预测、分类、回归等方法或过程。它是驱动模型构建与优化的核心机制。
1. 基本流程
- 数据输入:接收特征(输入变量)与标签(目标输出,监督场景下)
- 学习过程:在训练数据上寻找映射规则
- 模型输出:得到可用于推断的模型
2. 分类维度
(1)按任务目标
监督学习、无监督学习、半监督学习、强化学习(见上一节)。
(2)按学习方式
批量学习、在线学习。
(3)按学习策略
| 策略 | 说明 | 例子 |
|---|---|---|
| 实例学习(Instance-based) | 记忆训练实例,预测时查找 | KNN |
| 模型学习(Model-based) | 训练后构建模型再预测 | 决策树、线性回归、神经网络 |
3. 工作原理(训练过程)
学习 / 训练过程是指:用输入数据调整模型参数,使模型能提取规律并准确预测或分类。关键步骤:
- 获取数据:特征是学习基础,标签是监督目标
- 学习阶段(训练)
- 监督学习:通常最小化损失函数(如回归中使预测接近真实值)
- 无监督学习:寻找模式(聚类、降维等)
- 模型优化:通过梯度下降等方法调整参数
- 验证与评估:交叉验证;用准确率、均方误差等指标评估;关注过拟合 / 欠拟合
- 推理阶段(预测):用训练好的模型处理未见过的数据
4. 常见学习算法一览
| 算法 | 任务 | 原理要点 |
|---|---|---|
| 线性回归 | 回归 | 拟合线性方程,最小化预测误差 |
| SVM | 分类 / 回归 | 寻找最优超平面,最大化间隔 |
| 决策树 | 分类 / 回归 | 按特征条件逐层划分数据 |
| KNN | 分类 / 回归 | 根据邻居距离投票或平均 |
| 神经网络 | 分类 / 回归 / 生成 | 多层神经元学习复杂映射 |
| 随机森林 | 分类 / 回归 | 多棵决策树投票 / 平均 |
| K-Means | 聚类 | 划分为 ( k ) 个簇,簇内相似、簇间相异 |
5. 如何选择算法
| 考虑因素 | 建议 |
|---|---|
| 数据规模 | 大数据可考虑随机森林、神经网络等;小数据可用线性回归、决策树等 |
| 任务类型 | 回归、分类、聚类需对应不同算法族 |
| 计算资源 | 深度学习需 GPU 等资源;SVM、决策树相对轻量 |
| 数据形态 | 结构化 + 可手工特征 → 传统 ML;图像 / 文本等非结构化 → DL |
优点简述:监督算法在标注充分时效果好;无监督可发现隐藏结构;深度网络擅长复杂感知任务。
缺点简述:神经网络对预处理与算力要求高;简单模型难拟合复杂非线性;部分算法对噪声敏感。
五、贯穿算法的核心底层概念
这些概念决定算法「能不能学得好」以及「为什么能学」。
1. 损失函数(Loss Function)
量化预测与真实值之间的差距。
- 回归:均方误差(MSE)、平均绝对误差(MAE)
- 分类:交叉熵(Cross-Entropy)、合页损失(Hinge Loss)
2. 优化算法(Optimization)
告诉模型「怎么改参数」。
- 梯度下降:批量(BGD)、随机(SGD)、小批量(Mini-batch)
- 自适应优化器:Momentum、RMSprop、Adam、AdamW
3. 过拟合与欠拟合(Overfitting / Underfitting)
泛化的核心矛盾:
| 问题 | 表现 | 对策 |
|---|---|---|
| 过拟合 | 死记硬背训练集,新数据表现差 | 正则化(L1 / L2)、早停(Early Stopping)、Dropout、数据增强、交叉验证 |
| 欠拟合 | 连训练集都没学好 | 增加模型复杂度、增加特征、减弱正则化 |
4. 偏差-方差权衡(Bias-Variance Tradeoff)
- 简单模型(如线性回归):偏差高、方差低
- 复杂模型(如深度网络):偏差低、方差高
调参本质是在两者之间找平衡点。
5. 参数 vs 超参数
| 类型 | 说明 | 例子 |
|---|---|---|
| 参数(Parameters) | 模型内部自学 | 权重 ( W ) |
| 超参数(Hyperparameters) | 训练前人为设定 | 学习率、树深度、聚类数 ( K ) |
常用调参手段:网格搜索(Grid Search)、贝叶斯优化等。
6. 特征工程(Feature Engineering)
传统 ML 的核心环节,包括:归一化 / 标准化、缺失值处理、类别编码(One-Hot)、特征选择(卡方、互信息)、核技巧(Kernel Trick,如 SVM 升维)等。
7. 集成学习(Ensemble Learning)
| 方式 | 作用 | 代表 |
|---|---|---|
| Bagging(并行) | 减少方差 | 随机森林 |
| Boosting(串行) | 减少偏差 | AdaBoost、GBDT、XGBoost、CatBoost |
| Stacking(堆叠) | 元模型融合 | 多层模型组合 |
六、人工智能的研究领域分层
人工智能研究大致可分为五层:
- 基础设施:数据与算力——数据越大、算力越强,能力上限通常越高
- 算法层:CNN、LSTM、Q-Learning、深度学习等
- 技术方向:计算机视觉、语音、自然语言处理、决策系统、统计分析等
- 具体技术:图像识别、语音识别、机器翻译等
- 行业方案:金融、医疗、互联网、交通、游戏等落地应用
七、如何选择技术方案
| 优先选择 | 适用场景 |
|---|---|
| 传统机器学习 | 数据量较小(如 < 10 万样本);特征可人工提取;硬件资源有限 |
| 深度学习 | 非结构化数据(图像、语音、文本);特征难手工定义;计算资源充足 |
| 强化学习 | 决策序列问题(游戏 AI、路径规划);环境可模拟 |
| 大语言模型 | 自然语言任务;需要少样本 / 零样本;可容忍概率性输出 |
八、前沿融合与新兴概念
融合方向
- RL + DL:深度强化学习(DRL),如 AlphaGo、部分蛋白质结构预测管线
- LLM + RL:指令微调与对齐,如 ChatGPT 的 RLHF
- ANN 跨模态:多模态大模型(如同时处理文本与图像)
大模型时代值得关注的概念
| 概念 | 要点 |
|---|---|
| 缩放定律(Scaling Laws) | 参数量、数据量、计算量之间的幂律关系 |
| MoE(混合专家) | 条件计算,推理时只激活部分参数 |
| RLHF / DPO | 基于人类反馈或偏好的对齐算法 |
| LoRA / QLoRA | 参数高效微调(PEFT),降低微调成本 |
| RAG | 检索增强生成:推理时检索外部知识,而非仅依赖参数记忆 |
九、学习路径建议
- 基础理论:线性代数、概率论、微积分;Python + PyTorch / TensorFlow
- 循序渐进:传统 ML → 神经网络 → Transformer → RL → LLM
- 实战:Kaggle(ML / DL)、OpenAI Gym 类环境(RL)、Hugging Face(LLM)
结语
人工智能技术体系如同一棵大树:机器学习是主干,深度学习与强化学习是主要分支,大语言模型则是当前最茂盛的果实。理解其关联与差异,才能按问题选用合适工具。