Picture for Ke-Han Lu

Ke-Han Lu

Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

Add code
Jul 13, 2026
Viaarxiv icon

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

Add code
Jul 07, 2026
Viaarxiv icon

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

Add code
Jul 06, 2026
Viaarxiv icon

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

Add code
Jun 22, 2026
Viaarxiv icon

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

Add code
Jun 01, 2026
Viaarxiv icon

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

Add code
Apr 27, 2026
Viaarxiv icon

ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models

Add code
Apr 11, 2026
Viaarxiv icon

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

Add code
Mar 19, 2026
Viaarxiv icon

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

Add code
Mar 10, 2026
Viaarxiv icon

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

Add code
Jul 03, 2025
Figure 1 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 2 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 3 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Figure 4 for DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Viaarxiv icon