Picture for Ziyang Ma

Ziyang Ma

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

Add code
Jul 17, 2026
Viaarxiv icon

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Add code
Jun 23, 2026
Viaarxiv icon

Native Active Perception as Reasoning for Omni-Modal Understanding

Add code
Jun 17, 2026
Viaarxiv icon

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

Add code
Jun 09, 2026
Viaarxiv icon

MMAE: A Massive Multitask Audio Editing Benchmark

Add code
Jun 05, 2026
Viaarxiv icon

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

Add code
Jun 05, 2026
Viaarxiv icon

Audio Interaction Model

Add code
Jun 03, 2026
Viaarxiv icon

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

Add code
Jun 02, 2026
Viaarxiv icon

CONCAT: Consensus- and Confidence-Driven Ad Hoc Teaming for Efficient LLM-Based Multi-Agent Systems

Add code
May 28, 2026
Viaarxiv icon

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

Add code
May 25, 2026
Viaarxiv icon