Picture for Pan Zhou

Pan Zhou

The Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

Add code
Aug 03, 2026
Viaarxiv icon

RFMSR: Residual Flow Matching for Image Super-Resolution

Add code
Jul 14, 2026
Viaarxiv icon

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

Add code
Jun 22, 2026
Viaarxiv icon

Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

Add code
Jun 15, 2026
Viaarxiv icon

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation

Add code
Jun 09, 2026
Viaarxiv icon

LiAuto-GeoX: Efficient Grounded Driving Transformer

Add code
Jun 04, 2026
Viaarxiv icon

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving

Add code
Jun 03, 2026
Viaarxiv icon

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

Add code
Jun 01, 2026
Viaarxiv icon

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

Add code
May 29, 2026
Viaarxiv icon

Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language

Add code
May 28, 2026
Viaarxiv icon