Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

1Fudan University 2Hunyuan Foundation Model Team, Tencent Inc 3Zhejiang University

Demo Video

Synthesized Results

Please turn on your audio.

Model Comparisons

Please turn on your audio.

Ablation Study

Resolution Scaling