Picture for Yaole Wang

Yaole Wang

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Add code
Aug 06, 2026
Viaarxiv icon

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Add code
Aug 06, 2026
Viaarxiv icon

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

Add code
Jun 06, 2026
Viaarxiv icon

Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

Add code
May 07, 2024
Figure 1 for Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Figure 2 for Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Figure 3 for Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Figure 4 for Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Viaarxiv icon

One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale

Add code
Mar 12, 2023
Figure 1 for One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale
Figure 2 for One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale
Figure 3 for One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale
Figure 4 for One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale
Viaarxiv icon