Picture for Ante Jukić

Ante Jukić

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Add code
Jul 07, 2026
Viaarxiv icon

DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling

Add code
May 22, 2026
Viaarxiv icon

MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding

Add code
Feb 24, 2026
Viaarxiv icon

Universal Speech Enhancement with Regression and Generative Mamba

Add code
May 27, 2025
Figure 1 for Universal Speech Enhancement with Regression and Generative Mamba
Figure 2 for Universal Speech Enhancement with Regression and Generative Mamba
Figure 3 for Universal Speech Enhancement with Regression and Generative Mamba
Figure 4 for Universal Speech Enhancement with Regression and Generative Mamba
Viaarxiv icon

Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement

Add code
May 07, 2025
Figure 1 for Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
Figure 2 for Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
Figure 3 for Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
Figure 4 for Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
Viaarxiv icon

Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration

Add code
Sep 25, 2024
Figure 1 for Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
Figure 2 for Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
Figure 3 for Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
Figure 4 for Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
Viaarxiv icon

Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference

Add code
Sep 18, 2024
Figure 1 for Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
Viaarxiv icon

Schrödinger Bridge for Generative Speech Enhancement

Add code
Jul 22, 2024
Figure 1 for Schrödinger Bridge for Generative Speech Enhancement
Figure 2 for Schrödinger Bridge for Generative Speech Enhancement
Figure 3 for Schrödinger Bridge for Generative Speech Enhancement
Figure 4 for Schrödinger Bridge for Generative Speech Enhancement
Viaarxiv icon

Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations

Add code
Jul 03, 2024
Figure 1 for Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
Figure 2 for Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
Figure 3 for Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
Figure 4 for Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
Viaarxiv icon

Spectral Codecs: Spectrogram-Based Audio Codecs for High Quality Speech Synthesis

Add code
Jun 07, 2024
Figure 1 for Spectral Codecs: Spectrogram-Based Audio Codecs for High Quality Speech Synthesis
Figure 2 for Spectral Codecs: Spectrogram-Based Audio Codecs for High Quality Speech Synthesis
Figure 3 for Spectral Codecs: Spectrogram-Based Audio Codecs for High Quality Speech Synthesis
Viaarxiv icon