Picture for Xinyang Song

Xinyang Song

GroupVideo: Multi-Identity Customized Text-to-Video Generation

Add code
Jul 23, 2026
Viaarxiv icon

WorldSample: Closed-loop Real-robot RL with World Modelling

Add code
Jul 02, 2026
Viaarxiv icon

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

Add code
Jun 23, 2026
Viaarxiv icon

Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks

Add code
Jan 09, 2026
Viaarxiv icon

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

Add code
Dec 22, 2025
Figure 1 for 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
Figure 2 for 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
Figure 3 for 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
Figure 4 for 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
Viaarxiv icon

Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance

Add code
Dec 21, 2024
Figure 1 for Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
Figure 2 for Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
Figure 3 for Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
Figure 4 for Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
Viaarxiv icon