Picture for Dongchao Yang

Dongchao Yang

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

Add code
Aug 09, 2026
Viaarxiv icon

Audio Interaction Model

Add code
Jun 03, 2026
Viaarxiv icon

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

Add code
May 22, 2026
Viaarxiv icon

Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs

Add code
Aug 25, 2025
Viaarxiv icon

DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models

Add code
Aug 12, 2025
Viaarxiv icon

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

Add code
Jun 05, 2025
Viaarxiv icon

SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline

Add code
May 25, 2025
Viaarxiv icon

Kimi-Audio Technical Report

Add code
Apr 25, 2025
Figure 1 for Kimi-Audio Technical Report
Figure 2 for Kimi-Audio Technical Report
Figure 3 for Kimi-Audio Technical Report
Figure 4 for Kimi-Audio Technical Report
Viaarxiv icon

UniSep: Universal Target Audio Separation with Language Models at Scale

Add code
Mar 31, 2025
Figure 1 for UniSep: Universal Target Audio Separation with Language Models at Scale
Figure 2 for UniSep: Universal Target Audio Separation with Language Models at Scale
Figure 3 for UniSep: Universal Target Audio Separation with Language Models at Scale
Figure 4 for UniSep: Universal Target Audio Separation with Language Models at Scale
Viaarxiv icon

MoonCast: High-Quality Zero-Shot Podcast Generation

Add code
Mar 19, 2025
Figure 1 for MoonCast: High-Quality Zero-Shot Podcast Generation
Figure 2 for MoonCast: High-Quality Zero-Shot Podcast Generation
Figure 3 for MoonCast: High-Quality Zero-Shot Podcast Generation
Figure 4 for MoonCast: High-Quality Zero-Shot Podcast Generation
Viaarxiv icon