Text-to-video generation model based on a factorized diffusion process.
Meta published Emu Video, a factorized text-to-video generation method.