Picture for Zhuohan Liu

Zhuohan Liu

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

Add code
Aug 05, 2026
Viaarxiv icon

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

Add code
Aug 04, 2026
Viaarxiv icon

SportD: Can VLMs Physically Strategize?

Add code
Jul 16, 2026
Viaarxiv icon

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

Add code
May 27, 2026
Viaarxiv icon

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

Add code
Feb 27, 2026
Viaarxiv icon

Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs

Add code
Jun 07, 2025
Viaarxiv icon

Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models

Add code
Jan 02, 2025
Figure 1 for Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
Figure 2 for Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
Figure 3 for Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
Figure 4 for Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
Viaarxiv icon

MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models

Add code
Dec 18, 2024
Figure 1 for MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models
Figure 2 for MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models
Viaarxiv icon

MERaLiON-AudioLLM: Technical Report

Add code
Dec 13, 2024
Figure 1 for MERaLiON-AudioLLM: Technical Report
Figure 2 for MERaLiON-AudioLLM: Technical Report
Viaarxiv icon

MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders

Add code
Sep 10, 2024
Figure 1 for MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
Figure 2 for MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
Figure 3 for MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
Figure 4 for MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
Viaarxiv icon