Picture for Han Zhao

Han Zhao

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

Add code
Aug 11, 2026
Viaarxiv icon

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Add code
Aug 05, 2026
Viaarxiv icon

Qwen-Audio-3.0-Gen-Preview Technical Report

Add code
Jul 29, 2026
Viaarxiv icon

Steering Instruction Hierarchies at Inference Time

Add code
Jul 28, 2026
Viaarxiv icon

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

Add code
Jul 27, 2026
Viaarxiv icon

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

Add code
Jul 23, 2026
Viaarxiv icon

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

Add code
Jul 22, 2026
Viaarxiv icon

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech

Add code
Jun 22, 2026
Viaarxiv icon

JourneyFormer: Encoding Airbnb Guest Journey with Sequence Modeling

Add code
Jun 17, 2026
Viaarxiv icon

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

Add code
Jun 11, 2026
Viaarxiv icon