Picture for Juan Liu

Juan Liu

Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE

Add code
Aug 06, 2026
Viaarxiv icon

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework

Add code
Jul 21, 2026
Viaarxiv icon

ECHOv2: Two-Level Band-Splitting Representation Learning for Anomalous Sound Detection

Add code
Jul 12, 2026
Viaarxiv icon

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

Add code
Jun 04, 2026
Viaarxiv icon

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

Add code
Apr 24, 2026
Viaarxiv icon

Multi-View Based Audio Visual Target Speaker Extraction

Add code
Mar 11, 2026
Viaarxiv icon

Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge

Add code
Mar 09, 2026
Viaarxiv icon

Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement

Add code
Mar 04, 2026
Viaarxiv icon

Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings

Add code
Oct 10, 2025
Viaarxiv icon

ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signal

Add code
Aug 20, 2025
Figure 1 for ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signal
Figure 2 for ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signal
Figure 3 for ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signal
Viaarxiv icon