Picture for Zezhou Cheng

Zezhou Cheng

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

Add code
Jun 22, 2026
Viaarxiv icon

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

Add code
Jun 10, 2026
Viaarxiv icon

OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query Transformer

Add code
Apr 27, 2026
Viaarxiv icon

WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments

Add code
Jan 15, 2026
Viaarxiv icon

LabelAny3D: Label Any Object 3D in the Wild

Add code
Jan 04, 2026
Viaarxiv icon

Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision

Add code
Dec 11, 2025
Figure 1 for Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
Figure 2 for Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
Figure 3 for Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
Figure 4 for Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
Viaarxiv icon

Point-MoE: Towards Cross-Domain Generalization in 3D Semantic Segmentation via Mixture-of-Experts

Add code
May 29, 2025
Viaarxiv icon

Frame In-N-Out: Unbounded Controllable Image-to-Video Generation

Add code
May 27, 2025
Viaarxiv icon

Open Vocabulary Monocular 3D Object Detection

Add code
Nov 25, 2024
Viaarxiv icon

Learning 3D Representations from Procedural 3D Programs

Add code
Nov 25, 2024
Figure 1 for Learning 3D Representations from Procedural 3D Programs
Figure 2 for Learning 3D Representations from Procedural 3D Programs
Figure 3 for Learning 3D Representations from Procedural 3D Programs
Figure 4 for Learning 3D Representations from Procedural 3D Programs
Viaarxiv icon