Picture for Zhizhou Zhong

Zhizhou Zhong

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

Add code
Jun 04, 2026
Viaarxiv icon

KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

Add code
May 14, 2026
Viaarxiv icon

EponaV2: Driving World Model with Comprehensive Future Reasoning

Add code
May 14, 2026
Viaarxiv icon

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

Add code
May 10, 2026
Viaarxiv icon

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

Add code
Mar 13, 2026
Viaarxiv icon

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

Add code
Feb 11, 2026
Viaarxiv icon

NeRF-MIR: Towards High-Quality Restoration of Masked Images with Neural Radiance Fields

Add code
Jan 24, 2026
Viaarxiv icon

IDDR-NGP: Incorporating Detectors for Distractor Removal with Instant Neural Radiance Field

Add code
Jan 16, 2026
Viaarxiv icon

VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization

Add code
May 19, 2025
Viaarxiv icon

Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion

Add code
Apr 01, 2025
Figure 1 for Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion
Figure 2 for Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion
Figure 3 for Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion
Figure 4 for Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion
Viaarxiv icon