Picture for Wei Rao

Wei Rao

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

Add code
Jun 24, 2026
Viaarxiv icon

VoxWatermark: A Large-Scale Benchmark for Audio Watermark Detection under Perturbations

Add code
Jun 13, 2026
Viaarxiv icon

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

Add code
Apr 16, 2026
Viaarxiv icon

Training-Free Intelligibility-Guided Observation Addition for Noisy ASR

Add code
Feb 24, 2026
Viaarxiv icon

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model

Add code
Dec 24, 2025
Viaarxiv icon

Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization

Add code
Dec 07, 2023
Figure 1 for Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization
Figure 2 for Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization
Figure 3 for Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization
Figure 4 for Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization
Viaarxiv icon

The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022

Add code
Jul 28, 2023
Figure 1 for The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022
Figure 2 for The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022
Figure 3 for The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022
Viaarxiv icon

MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation

Add code
Jun 28, 2023
Figure 1 for MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation
Figure 2 for MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation
Figure 3 for MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation
Figure 4 for MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation
Viaarxiv icon

Gesper: A Restoration-Enhancement Framework for General Speech Reconstruction

Add code
Jun 14, 2023
Viaarxiv icon

Inter-SubNet: Speech Enhancement with Subband Interaction

Add code
May 09, 2023
Figure 1 for Inter-SubNet: Speech Enhancement with Subband Interaction
Figure 2 for Inter-SubNet: Speech Enhancement with Subband Interaction
Figure 3 for Inter-SubNet: Speech Enhancement with Subband Interaction
Figure 4 for Inter-SubNet: Speech Enhancement with Subband Interaction
Viaarxiv icon