直接回答:这四个词是层层包含的关系:人工智能最大,机器学习是它的核心技术,深度学习是机器学习的分支,神经网络是实现深度学习的基础架构。日常说的 AI 大模型,基本都落在最里面的那层。

机器学习是人工智能的核心技术之一,而深度学习是机器学习的分支,神经网络则是深度学习的基础架构

人工智能、机器学习、神经网络关系梳理

人工智能(AI)

  • 类型:概念

  • 描述:最大范畴,涵盖所有让机器模仿人类智能的技术,如语音识别、自动驾驶、机器人等。

  • 包含两大方向:

    • 机器学习(ML)
      • 类型:技术
      • 描述:让机器从数据中学习规律,例如预测房价。
    • 非 ML 方法
      • 类型:概念
      • 描述:包括专家系统(基于规则推理,属于技术,利用预先设定的规则和知识进行推理以解决问题)、符号逻辑(属于概念,是一种基于符号表示和逻辑推理的方法)等。

机器学习(ML)

  • 类型:技术

  • 描述:AI 的核心实现手段,通过算法从数据中总结规律,无需显式编程。

  • 包含两类方法:

    • 传统方法
      • 类型:概念
      • 描述:包含多种具体算法,以下详细介绍几种常见算法:
        • 线性回归
          • 类型:算法
          • 描述:通过构建一个线性方程来描述自变量和因变量之间的关系,以预测连续型数值。
          • 常见类型:简单线性回归,仅包含一个自变量,公式为(y = \beta_0 + \beta_1x + \epsilon),其中(y)是因变量,(x)是自变量,(\beta_0)是截距,(\beta_1)是斜率,(\epsilon)是误差项;多元线性回归,包含多个自变量,公式为(y = \beta_0 + \beta_1x_1 + \beta_2x_2 + \cdots + \beta_nx_n + \epsilon) ,可用于预测房价,根据房屋面积、房龄、周边配套设施等多个因素预测房价。
          • 原理:通过最小化损失函数(通常是均方误差)来确定线性方程的系数,使得预测值与实际值之间的误差最小。
          • 应用场景:除房价预测外,还用于销售预测、股票价格预测等。
        • 决策树
          • 类型:算法
          • 描述:用于分类,通过对数据特征进行分割,构建树状结构来进行决策分类。
          • 常见类型:ID3 算法,以信息增益作为特征选择的度量标准;C4.5 算法,对 ID3 进行改进,使用信息增益比来选择特征;CART(分类与回归树),既可以用于分类,也可以用于回归。
          • 原理:从根节点开始,根据数据特征选择最优划分属性,递归地构建决策树,直到满足停止条件。
          • 应用场景:判断邮件是否为垃圾邮件、疾病诊断、客户细分等。
        • SVM(支持向量机)
          • 类型:算法
          • 描述:用于分类,通过寻找最优超平面将不同类别的数据分开。
          • 常见类型:线性 SVM,适用于线性可分的数据;非线性 SVM,通过核函数将数据映射到高维空间,使其变得线性可分。
          • 原理:最大化分类间隔,找到最优超平面,对于非线性问题,通过核函数实现非线性映射。
          • 应用场景:图像分类、文本分类、生物信息学中的蛋白质分类等。
    • 神经网络(NN)
      • 类型:技术
      • 描述:模拟人脑神经元结构的模型,常用于图像识别。

神经网络(NN)

  • 类型:技术

  • 描述:ML 的进阶方法,擅长处理复杂非线性问题,如信用卡欺诈检测。

  • 分为两种结构:

    • 浅层网络
      • 类型:概念
      • 描述:包含一些具体模型,如:
        • 感知机
          • 类型:算法(模型)
          • 描述:用于简单分类,是神经网络的基础模型,通过对输入进行加权求和并经过激活函数处理得到输出,判断类别。
          • 原理:基于阈值逻辑,根据输入和权重计算加权和,与阈值比较后通过激活函数输出。
          • 应用场景:简单的二分类问题,如判断一个点在直线的哪一侧。
        • BP 神经网络(反向传播神经网络)
          • 类型:算法(模型)
          • 描述:早期用于图像识别等,通过反向传播算法来调整网络的权重和偏置,以最小化误差。
          • 原理:正向传播计算输出,反向传播计算误差并更新权重和偏置,利用梯度下降法不断优化模型。
          • 应用场景:手写数字识别、简单图像分类等。
    • 深度学习(DL)
      • 类型:技术
      • 描述:通过多层结构自动提取高阶特征。

深度学习(DL)

  • 类型:技术

  • 描述:神经网络的延伸,核心是 “深度”(多层隐藏结构),依赖大数据和算力。

  • 包含四大主流模型:

    • CNN(卷积神经网络)
      • 类型:算法(模型)
      • 描述:专攻图像,用卷积核提取纹理特征。
      • 常见类型:LeNet(早期用于手写数字识别)、AlexNet(推动了深度学习在图像领域的发展)、VGGNet(通过堆叠小卷积核来加深网络)、ResNet(引入残差连接解决深度网络训练难题)等。
      • 原理:通过卷积层、池化层和全连接层等构建网络,卷积层利用卷积核提取局部特征,池化层降低数据维度,全连接层进行分类或回归。
      • 应用场景:人脸识别、图像分割、目标检测、医学影像分析等。
    • RNN(循环神经网络)
      • 类型:算法(模型)
      • 描述:处理序列数据。
      • 常见类型:LSTM(长短期记忆网络,解决了 RNN 中梯度消失的问题,能更好处理长序列)、GRU(门控循环单元,是 LSTM 的简化版本)等。
      • 原理:通过隐藏层的循环连接,将上一时刻的隐藏状态和当前时刻的输入一起作为当前时刻的输入,从而处理序列数据。
      • 应用场景:股票预测、机器翻译、情感分析、语音识别等。
    • GAN(生成对抗网络)
      • 类型:算法(模型)
      • 描述:生成逼真数据。
      • 常见类型:DCGAN(深度卷积生成对抗网络,将卷积神经网络应用于 GAN)、WGAN(改进了 GAN 训练不稳定的问题)等。
      • 原理:由生成器和判别器组成,生成器生成数据,判别器判断数据是真实的还是生成的,两者通过对抗训练不断优化。
      • 应用场景:AI 绘画、视频修复、数据增强、虚拟人脸合成等。
    • Transformer
      • 类型:算法(模型)
      • 描述:基于自注意力机制,擅长长序列建模和跨模态任务。
      • 常见应用模型:BERT(双向 Transformer 的 Encoder 部分,用于自然语言处理的预训练模型)、GPT(基于 Transformer 的 Decoder 部分,用于生成式自然语言处理任务)等。
      • 原理:利用自注意力机制,对输入序列中的每个位置进行全局建模,计算每个位置与其他位置的关联程度,从而更好地捕捉长距离依赖。
      • 应用场景:文本翻译、文本生成、智能问答、图文生成等。

二、典型应用场景

层级 技术 任务类型 实际案例
传统 ML 线性回归 数值预测 房价预测
神经网络 BP 网络 模式识别 手写数字识别
深度学习 CNN 图像分类 医学影像分析
深度学习 Transformer 文本生成 ChatGPT 对话
深度学习 GAN 数据生成 虚拟人脸合成

三、关键区别总结

对比项 区别描述
AI vs ML AI 是目标,旨在模拟人类智能;ML 是实现 AI 的手段,通过数据驱动让机器学习规律
ML vs DL ML 依赖人工特征工程,需要人工提取和选择数据特征;DL 自动提取特征,通过多层神经网络从原始数据中自动学习特征表示
Transformer vs RNN RNN 按顺序处理数据,适合处理短序列数据,但在处理长序列时存在梯度消失和梯度爆炸问题;Transformer 并行计算,能捕捉长距离依赖,更适合长序列建模
GAN vs CNN CNN 用于识别和分类任务,通过学习数据特征进行模式识别;GAN 用于生成新数据,通过生成器和判别器的对抗训练生成逼真的数据样本

从层级关系上,可以直观看到:AI > ML > NN > DL > (CNN/RNN/GAN/Transformer),每个层级不断细化,解决更具体、更细分的问题。

四、技术应用场景对比

方法 数据要求 典型场景 优势与局限
自监督学习 大量无标注数据 文本预训练、图像表征学习 减少标注依赖,但代理任务设计复杂8
弱监督学习 少量标注或噪声标注 医学影像分析、目标检测 成本低,但模型易受噪声干扰26
神经网络 依赖任务类型(需标注或无标注) 图像分类、语音识别、自然语言处理 泛化能力强,但需大量算力16

这篇笔记整理自我自己的实践记录,如果做法有出入,或者你踩过别的坑,欢迎到留言板一起聊聊。

站内搜索

没有找到内容!