直接回答:这四个词是层层包含的关系:人工智能最大,机器学习是它的核心技术,深度学习是机器学习的分支,神经网络是实现深度学习的基础架构。日常说的 AI 大模型,基本都落在最里面的那层。
机器学习是人工智能的核心技术之一,而深度学习是机器学习的分支,神经网络则是深度学习的基础架构
人工智能、机器学习、神经网络关系梳理
人工智能(AI)
类型:概念
描述:最大范畴,涵盖所有让机器模仿人类智能的技术,如语音识别、自动驾驶、机器人等。
包含两大方向:
- 机器学习(ML)
- 类型:技术
- 描述:让机器从数据中学习规律,例如预测房价。
- 非 ML 方法
- 类型:概念
- 描述:包括专家系统(基于规则推理,属于技术,利用预先设定的规则和知识进行推理以解决问题)、符号逻辑(属于概念,是一种基于符号表示和逻辑推理的方法)等。
机器学习(ML)
类型:技术
描述:AI 的核心实现手段,通过算法从数据中总结规律,无需显式编程。
包含两类方法:
- 传统方法
- 类型:概念
- 描述:包含多种具体算法,以下详细介绍几种常见算法:
- 线性回归
- 类型:算法
- 描述:通过构建一个线性方程来描述自变量和因变量之间的关系,以预测连续型数值。
- 常见类型:简单线性回归,仅包含一个自变量,公式为(y = \beta_0 + \beta_1x + \epsilon),其中(y)是因变量,(x)是自变量,(\beta_0)是截距,(\beta_1)是斜率,(\epsilon)是误差项;多元线性回归,包含多个自变量,公式为(y = \beta_0 + \beta_1x_1 + \beta_2x_2 + \cdots + \beta_nx_n + \epsilon) ,可用于预测房价,根据房屋面积、房龄、周边配套设施等多个因素预测房价。
- 原理:通过最小化损失函数(通常是均方误差)来确定线性方程的系数,使得预测值与实际值之间的误差最小。
- 应用场景:除房价预测外,还用于销售预测、股票价格预测等。
- 决策树
- 类型:算法
- 描述:用于分类,通过对数据特征进行分割,构建树状结构来进行决策分类。
- 常见类型:ID3 算法,以信息增益作为特征选择的度量标准;C4.5 算法,对 ID3 进行改进,使用信息增益比来选择特征;CART(分类与回归树),既可以用于分类,也可以用于回归。
- 原理:从根节点开始,根据数据特征选择最优划分属性,递归地构建决策树,直到满足停止条件。
- 应用场景:判断邮件是否为垃圾邮件、疾病诊断、客户细分等。
- SVM(支持向量机)
- 类型:算法
- 描述:用于分类,通过寻找最优超平面将不同类别的数据分开。
- 常见类型:线性 SVM,适用于线性可分的数据;非线性 SVM,通过核函数将数据映射到高维空间,使其变得线性可分。
- 原理:最大化分类间隔,找到最优超平面,对于非线性问题,通过核函数实现非线性映射。
- 应用场景:图像分类、文本分类、生物信息学中的蛋白质分类等。
- 神经网络(NN)
- 类型:技术
- 描述:模拟人脑神经元结构的模型,常用于图像识别。
神经网络(NN)
类型:技术
描述:ML 的进阶方法,擅长处理复杂非线性问题,如信用卡欺诈检测。
分为两种结构:
- 浅层网络
- 类型:概念
- 描述:包含一些具体模型,如:
- 感知机
- 类型:算法(模型)
- 描述:用于简单分类,是神经网络的基础模型,通过对输入进行加权求和并经过激活函数处理得到输出,判断类别。
- 原理:基于阈值逻辑,根据输入和权重计算加权和,与阈值比较后通过激活函数输出。
- 应用场景:简单的二分类问题,如判断一个点在直线的哪一侧。
- BP 神经网络(反向传播神经网络)
- 类型:算法(模型)
- 描述:早期用于图像识别等,通过反向传播算法来调整网络的权重和偏置,以最小化误差。
- 原理:正向传播计算输出,反向传播计算误差并更新权重和偏置,利用梯度下降法不断优化模型。
- 应用场景:手写数字识别、简单图像分类等。
- 深度学习(DL)
- 类型:技术
- 描述:通过多层结构自动提取高阶特征。
深度学习(DL)
类型:技术
描述:神经网络的延伸,核心是 “深度”(多层隐藏结构),依赖大数据和算力。
包含四大主流模型:
- CNN(卷积神经网络)
- 类型:算法(模型)
- 描述:专攻图像,用卷积核提取纹理特征。
- 常见类型:LeNet(早期用于手写数字识别)、AlexNet(推动了深度学习在图像领域的发展)、VGGNet(通过堆叠小卷积核来加深网络)、ResNet(引入残差连接解决深度网络训练难题)等。
- 原理:通过卷积层、池化层和全连接层等构建网络,卷积层利用卷积核提取局部特征,池化层降低数据维度,全连接层进行分类或回归。
- 应用场景:人脸识别、图像分割、目标检测、医学影像分析等。
- RNN(循环神经网络)
- 类型:算法(模型)
- 描述:处理序列数据。
- 常见类型:LSTM(长短期记忆网络,解决了 RNN 中梯度消失的问题,能更好处理长序列)、GRU(门控循环单元,是 LSTM 的简化版本)等。
- 原理:通过隐藏层的循环连接,将上一时刻的隐藏状态和当前时刻的输入一起作为当前时刻的输入,从而处理序列数据。
- 应用场景:股票预测、机器翻译、情感分析、语音识别等。
- GAN(生成对抗网络)
- 类型:算法(模型)
- 描述:生成逼真数据。
- 常见类型:DCGAN(深度卷积生成对抗网络,将卷积神经网络应用于 GAN)、WGAN(改进了 GAN 训练不稳定的问题)等。
- 原理:由生成器和判别器组成,生成器生成数据,判别器判断数据是真实的还是生成的,两者通过对抗训练不断优化。
- 应用场景:AI 绘画、视频修复、数据增强、虚拟人脸合成等。
- Transformer
- 类型:算法(模型)
- 描述:基于自注意力机制,擅长长序列建模和跨模态任务。
- 常见应用模型:BERT(双向 Transformer 的 Encoder 部分,用于自然语言处理的预训练模型)、GPT(基于 Transformer 的 Decoder 部分,用于生成式自然语言处理任务)等。
- 原理:利用自注意力机制,对输入序列中的每个位置进行全局建模,计算每个位置与其他位置的关联程度,从而更好地捕捉长距离依赖。
- 应用场景:文本翻译、文本生成、智能问答、图文生成等。
二、典型应用场景
| 层级 | 技术 | 任务类型 | 实际案例 |
|---|---|---|---|
| 传统 ML | 线性回归 | 数值预测 | 房价预测 |
| 神经网络 | BP 网络 | 模式识别 | 手写数字识别 |
| 深度学习 | CNN | 图像分类 | 医学影像分析 |
| 深度学习 | Transformer | 文本生成 | ChatGPT 对话 |
| 深度学习 | GAN | 数据生成 | 虚拟人脸合成 |
三、关键区别总结
| 对比项 | 区别描述 |
|---|---|
| AI vs ML | AI 是目标,旨在模拟人类智能;ML 是实现 AI 的手段,通过数据驱动让机器学习规律 |
| ML vs DL | ML 依赖人工特征工程,需要人工提取和选择数据特征;DL 自动提取特征,通过多层神经网络从原始数据中自动学习特征表示 |
| Transformer vs RNN | RNN 按顺序处理数据,适合处理短序列数据,但在处理长序列时存在梯度消失和梯度爆炸问题;Transformer 并行计算,能捕捉长距离依赖,更适合长序列建模 |
| GAN vs CNN | CNN 用于识别和分类任务,通过学习数据特征进行模式识别;GAN 用于生成新数据,通过生成器和判别器的对抗训练生成逼真的数据样本 |
从层级关系上,可以直观看到:AI > ML > NN > DL > (CNN/RNN/GAN/Transformer),每个层级不断细化,解决更具体、更细分的问题。
四、技术应用场景对比
| 方法 | 数据要求 | 典型场景 | 优势与局限 |
|---|---|---|---|
| 自监督学习 | 大量无标注数据 | 文本预训练、图像表征学习 | 减少标注依赖,但代理任务设计复杂8 |
| 弱监督学习 | 少量标注或噪声标注 | 医学影像分析、目标检测 | 成本低,但模型易受噪声干扰26 |
| 神经网络 | 依赖任务类型(需标注或无标注) | 图像分类、语音识别、自然语言处理 | 泛化能力强,但需大量算力16 |
这篇笔记整理自我自己的实践记录,如果做法有出入,或者你踩过别的坑,欢迎到留言板一起聊聊。