Picture for Xiaoyi Zhang

Xiaoyi Zhang

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Add code
Jul 27, 2026
Viaarxiv icon

Generative Video Compression with Adaptive Score Distillation

Add code
Jul 24, 2026
Viaarxiv icon

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Add code
Jul 21, 2026
Viaarxiv icon

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

Add code
Jul 21, 2026
Viaarxiv icon

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

Add code
Jul 13, 2026
Viaarxiv icon

Multi-agent Framework for Time-Sensitive Complementary Collaboration in Minecraft

Add code
Jun 14, 2026
Viaarxiv icon

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

Add code
Jun 10, 2026
Viaarxiv icon

Ultra-Fast Neural Video Compression

Add code
Jun 03, 2026
Viaarxiv icon

CoD-Lite: Real-Time Diffusion-Based Generative Image Compression

Add code
Apr 14, 2026
Viaarxiv icon

Generative Video Compression with One-Dimensional Latent Representation

Add code
Mar 16, 2026
Viaarxiv icon