Picture for Xing Zhu

Xing Zhu

Native Video-Action Pretraining for Generalizable Robot Control

Add code
Jul 09, 2026
Viaarxiv icon

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

Add code
Jul 08, 2026
Viaarxiv icon

Infinite Worlds with Versatile Interactions

Add code
Jul 08, 2026
Viaarxiv icon

From Foundation to Application: Improving VLA Models in Practice

Add code
Jul 07, 2026
Viaarxiv icon

Vision Pretraining for Dense Spatial Perception

Add code
Jul 06, 2026
Viaarxiv icon

Tac-DINO: Learning Vision-Tactile Features with Patch Alignment

Add code
Jun 10, 2026
Viaarxiv icon

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Add code
Jun 09, 2026
Viaarxiv icon

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

Add code
May 21, 2026
Viaarxiv icon

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

Add code
May 12, 2026
Viaarxiv icon

Geometric Context Transformer for Streaming 3D Reconstruction

Add code
Apr 16, 2026
Viaarxiv icon