【计算机视觉实践14】基于U-Net模型实现宠物图像分割.pptxVIP

  • 0
  • 0
  • 约小于1千字
  • 约 12页
  • 2026-08-21 发布于山东
  • 举报

【计算机视觉实践14】基于U-Net模型实现宠物图像分割.pptx

1;其本质是像素级的分类:

对于图中的每一个像素给予一个像素级的label,即对于每一个像素归属到一个类别。;三种分割类型的定义:

语义分割:给每个pixel分类

实例分割:给每个检测框的里的object分mask

全景分割:背景pixel分类+框里mask;分割算法的基本流程:

输入:图像(RGB)+标注图像

算法:深度学习模型

输出:分割图像

训练过程:

输入:image+label

前向:out=model(image)

计算损失:loss=loss_func(out,label)

反向:loss.backward()

更新权重:optimizer.minimize(loss);One-hot编码;早期方法

视为逐像素分类,取待分类像素点为中心的局部图像,输入分类网络

大量像素重复计算

进行多个卷积层堆叠(使用thesamepadding以保持原有维度)

整个网络中保持全分辨率的计算成本非常高;一种主流方法是遵循编码器/解码器(encoder/decoder)结构:

先对输入进行下采样,得到较低分辨率的特征映射,其学习到了如何高效地区分各个类。

然后对这些特征进行上采样以得到一个原始分辨率的分割结果。;U-Net也是编码器-解码器结构的一个经典网络。

下采样

上采样

跳跃连接;;

编码器遵循典型的卷积网络结构

由两个重复的3*3卷积核组成

一个用于下采样的步长为2的2

文档评论(0)

1亿VIP精品文档

相关文档