翻译:Tutorial on Diffusion Models for Imaging and Vision

Posted by lili on September 5, 2024

本文翻译Tutorial on Diffusion Models for Imaging and Vision。

目录

Abstract

近年来,生成工具的惊人增长为文本到图像生成和文本到视频生成等许多激动人心的应用提供了支持。这些生成工具背后的基本原理是扩散概念,这是一种特殊的采样机制,它克服了以前方法中认为难以解决的一些缺陷。本教程的目标是讨论扩散模型背后的基本思想。本教程的目标受众包括对研究扩散模型或将这些模型应用于解决其他问题的本科生和研究生。

1 基础知识:变分自编码器(VAE)

1.1 VAE设置

很久以前,在一个遥远的星系,我们想要构建一个从潜在代码生成图像的生成器。最简单的(也许是最经典之一)方法是考虑下面展示的编码器-解码器对。这被称为变分自编码器(VAE)[1, 2, 3]。