Picture for Jiaming Zhou

Jiaming Zhou

Native Video-Action Pretraining for Generalizable Robot Control

Add code
Jul 09, 2026
Viaarxiv icon

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Add code
Jun 09, 2026
Viaarxiv icon

UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning

Add code
Jun 03, 2026
Viaarxiv icon

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

Add code
Apr 09, 2026
Viaarxiv icon

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

Add code
Jan 30, 2026
Viaarxiv icon

Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue

Add code
Jan 26, 2026
Viaarxiv icon

From Watch to Imagine: Steering Long-horizon Manipulation via Human Demonstration and Future Envisionment

Add code
Sep 26, 2025
Viaarxiv icon

Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning

Add code
Sep 18, 2025
Viaarxiv icon

End-to-End Humanoid Robot Safe and Comfortable Locomotion Policy

Add code
Aug 11, 2025
Viaarxiv icon

StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling

Add code
Jun 14, 2025
Viaarxiv icon