Chapter 36
multimodal
方案:VAE Encoder(视频压缩) -> Transform Diffusion (从视频数据中学习分布,并根据条件生成新视频) -> VAE Decoder (视频解压缩)
从博客出发,经过学术Survey,可以推断出全貌。一句话结论:
Sora是采用了Meta的 DiT (2022.12) 框架, 融合了Google的 MAGViT (2022.12) 的Video Tokenize方案, 借用Google DeepMind的NaViT (2023.07) 支持了原始比例和分辨率, 使用OpenAI DALL-E 3 (2023.09) 里的图像描述方案生成了高质量Video Caption(视频描述),即文本-视频对,实现了准确的条件生成。
