Model
1 entry · 16 December 2025
The model generates video and audio through a single diffusion transformer rather than a separate pass, aiming for accurate lip-sync across eight languages.
Models & capabilities