Picture for Botian Jiang

Botian Jiang

MOSS-VL Technical Report

Add code
Aug 15, 2026
Viaarxiv icon

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

Add code
Aug 09, 2026
Viaarxiv icon

MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions

Add code
Mar 30, 2026
Viaarxiv icon

MOSS-TTSD: Text to Spoken Dialogue Generation

Add code
Mar 20, 2026
Viaarxiv icon

MOSS-TTS Technical Report

Add code
Mar 18, 2026
Viaarxiv icon

WESR: Scaling and Evaluating Word-level Event-Speech Recognition

Add code
Jan 08, 2026
Viaarxiv icon

UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets

Add code
Sep 18, 2025
Viaarxiv icon

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Add code
Sep 18, 2025
Viaarxiv icon

Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners

Add code
Mar 03, 2025
Figure 1 for Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners
Figure 2 for Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners
Figure 3 for Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners
Figure 4 for Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners
Viaarxiv icon

Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models

Add code
Nov 14, 2024
Figure 1 for Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
Figure 2 for Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
Figure 3 for Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
Figure 4 for Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
Viaarxiv icon