Picture for Xiang Bai

Xiang Bai

Huazhong University of Science and Technology

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Add code
Jul 29, 2026
Viaarxiv icon

Achieving Text-based Person Retrieval with Any Granularity

Add code
Jul 23, 2026
Viaarxiv icon

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

Add code
Jul 21, 2026
Viaarxiv icon

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

Add code
Jul 20, 2026
Viaarxiv icon

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

Add code
Jul 13, 2026
Viaarxiv icon

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

Add code
Jul 13, 2026
Viaarxiv icon

Wat3R: Underwater 3D Geometry Learning without Annotations

Add code
Jul 09, 2026
Viaarxiv icon

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

Add code
Jul 09, 2026
Viaarxiv icon

R-DMesh: Video-Guided 3D Animation via Rectified Dynamic Mesh Flow

Add code
May 14, 2026
Viaarxiv icon

DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

Add code
Apr 21, 2026
Viaarxiv icon