Picture for Kaicheng Luo

Kaicheng Luo

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

Add code
Jun 22, 2026
Viaarxiv icon

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

Add code
Jun 22, 2026
Viaarxiv icon

ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing

Add code
Jun 26, 2025
Figure 1 for ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
Figure 2 for ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
Figure 3 for ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
Figure 4 for ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
Viaarxiv icon

OmniAudio: Generating Spatial Audio from 360-Degree Video

Add code
Apr 21, 2025
Figure 1 for OmniAudio: Generating Spatial Audio from 360-Degree Video
Figure 2 for OmniAudio: Generating Spatial Audio from 360-Degree Video
Figure 3 for OmniAudio: Generating Spatial Audio from 360-Degree Video
Figure 4 for OmniAudio: Generating Spatial Audio from 360-Degree Video
Viaarxiv icon