Picture for Xiao-Lei Zhang

Xiao-Lei Zhang

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

Add code
Aug 10, 2026
Viaarxiv icon

Positive-Incentive Noise Predictor for Adversarial Purification in Speaker Verification

Add code
Jul 01, 2026
Viaarxiv icon

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

Add code
Jun 15, 2026
Viaarxiv icon

High-Fidelity Generative Audio Compression at 0.275kbps

Add code
Jan 31, 2026
Viaarxiv icon

Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models

Add code
Dec 26, 2025
Viaarxiv icon

MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations

Add code
Aug 26, 2025
Figure 1 for MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
Figure 2 for MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
Figure 3 for MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
Figure 4 for MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
Viaarxiv icon

PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding

Add code
Aug 20, 2025
Figure 1 for PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
Figure 2 for PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
Figure 3 for PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
Figure 4 for PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
Viaarxiv icon

Angle-distance decomposition based on deep learning for active sonar detection

Add code
Jul 28, 2025
Figure 1 for Angle-distance decomposition based on deep learning for active sonar detection
Figure 2 for Angle-distance decomposition based on deep learning for active sonar detection
Figure 3 for Angle-distance decomposition based on deep learning for active sonar detection
Figure 4 for Angle-distance decomposition based on deep learning for active sonar detection
Viaarxiv icon

Bridging the Gap between Continuous and Informative Discrete Representations by Random Product Quantization

Add code
Apr 07, 2025
Viaarxiv icon

DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model

Add code
Feb 26, 2025
Figure 1 for DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
Figure 2 for DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
Figure 3 for DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
Figure 4 for DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
Viaarxiv icon