OmniVAE:跨模态对齐的音视频 VAE 实现联合生成
现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。
查看原文