Picture for Gus Xia

Gus Xia

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

Add code
Aug 04, 2026
Viaarxiv icon

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

Add code
Jul 12, 2026
Viaarxiv icon

Turning music identification into a neural forward pass

Add code
Jun 15, 2026
Viaarxiv icon

Who Gets Heard? Rethinking Fairness in AI for Music Systems

Add code
Nov 08, 2025
Viaarxiv icon

YuE: Scaling Open Foundation Models for Long-Form Music Generation

Add code
Mar 11, 2025
Viaarxiv icon

Music for All: Exploring Multicultural Representations in Music Generation Models

Add code
Feb 12, 2025
Figure 1 for Music for All: Exploring Multicultural Representations in Music Generation Models
Figure 2 for Music for All: Exploring Multicultural Representations in Music Generation Models
Figure 3 for Music for All: Exploring Multicultural Representations in Music Generation Models
Figure 4 for Music for All: Exploring Multicultural Representations in Music Generation Models
Viaarxiv icon

M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models

Add code
Oct 13, 2024
Figure 1 for M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models
Figure 2 for M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models
Figure 3 for M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models
Figure 4 for M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models
Viaarxiv icon

CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control

Add code
Oct 03, 2024
Figure 1 for CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
Figure 2 for CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
Figure 3 for CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
Figure 4 for CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
Viaarxiv icon

Foundation Models for Music: A Survey

Add code
Aug 27, 2024
Figure 1 for Foundation Models for Music: A Survey
Figure 2 for Foundation Models for Music: A Survey
Figure 3 for Foundation Models for Music: A Survey
Figure 4 for Foundation Models for Music: A Survey
Viaarxiv icon

Unlocking Potential in Pre-Trained Music Language Models for Versatile Multi-Track Music Arrangement

Add code
Aug 27, 2024
Figure 1 for Unlocking Potential in Pre-Trained Music Language Models for Versatile Multi-Track Music Arrangement
Figure 2 for Unlocking Potential in Pre-Trained Music Language Models for Versatile Multi-Track Music Arrangement
Figure 3 for Unlocking Potential in Pre-Trained Music Language Models for Versatile Multi-Track Music Arrangement
Figure 4 for Unlocking Potential in Pre-Trained Music Language Models for Versatile Multi-Track Music Arrangement
Viaarxiv icon