Picture for Qingyu Luo

Qingyu Luo

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

Add code
Jun 27, 2026
Viaarxiv icon

Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

Add code
Jun 26, 2026
Viaarxiv icon

Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing

Add code
Sep 17, 2025
Viaarxiv icon