Picture for Yuki Saito

Yuki Saito

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

Add code
Jul 15, 2026
Viaarxiv icon

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

Add code
Jul 06, 2026
Viaarxiv icon

Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers

Add code
Jul 02, 2026
Viaarxiv icon

CraBERT: Efficient Phoneme Encoder Pre-Training via Cascade Fusion of Subword Representations for Text-to-Speech

Add code
Jun 15, 2026
Viaarxiv icon

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

Add code
Jun 11, 2026
Viaarxiv icon

Probing Token Spaces under Generator Shift in AI-Generated Music Detection

Add code
Jun 07, 2026
Viaarxiv icon

Do speech foundation models perceive speaker similarity as humans do?

Add code
Jun 04, 2026
Viaarxiv icon

Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech

Add code
May 10, 2026
Viaarxiv icon

DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio

Add code
Apr 13, 2026
Viaarxiv icon

DecompGrind: A Decomposition Framework for Robotic Grinding via Cutting-Surface Planning and Contact-Force Adaptation

Add code
Mar 24, 2026
Viaarxiv icon