Picture for Shimin Li

Shimin Li

MOSS-VL Technical Report

Add code
Aug 15, 2026
Viaarxiv icon

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

Add code
Jul 26, 2026
Viaarxiv icon

MOSS-Audio Technical Report

Add code
Jun 01, 2026
Viaarxiv icon

MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions

Add code
Mar 30, 2026
Viaarxiv icon

MOSS-TTSD: Text to Spoken Dialogue Generation

Add code
Mar 20, 2026
Viaarxiv icon

MOSS-TTS Technical Report

Add code
Mar 18, 2026
Viaarxiv icon

MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models

Add code
Feb 12, 2026
Viaarxiv icon

MOVA: Towards Scalable and Synchronized Video-Audio Generation

Add code
Feb 09, 2026
Viaarxiv icon

WESR: Scaling and Evaluating Word-level Event-Speech Recognition

Add code
Jan 08, 2026
Viaarxiv icon

MOSS Transcribe Diarize: Accurate Transcription with Speaker Diarization

Add code
Jan 08, 2026
Viaarxiv icon