Picture for Zeyu Jin

Zeyu Jin

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

Add code
Aug 12, 2026
Viaarxiv icon

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

Add code
Aug 08, 2026
Viaarxiv icon

Do Speech Emphasis Models Generalize across Languages and Emotions?

Add code
Jun 26, 2026
Viaarxiv icon

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

Add code
May 26, 2026
Viaarxiv icon

Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning

Add code
Mar 31, 2026
Viaarxiv icon

Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers

Add code
Feb 09, 2026
Viaarxiv icon

PromptSep: Generative Audio Separation via Multimodal Prompting

Add code
Nov 06, 2025
Viaarxiv icon

Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech

Add code
Apr 15, 2025
Viaarxiv icon

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

Add code
Apr 13, 2025
Viaarxiv icon

SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation

Add code
Apr 07, 2025
Figure 1 for SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation
Figure 2 for SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation
Figure 3 for SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation
Figure 4 for SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation
Viaarxiv icon