Picture for Shizun Wang

Shizun Wang

Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction

Add code
Jun 22, 2026
Viaarxiv icon

World Action Models: A Survey

Add code
Jun 18, 2026
Viaarxiv icon

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

Add code
May 20, 2026
Viaarxiv icon

Make Geometry Matter for Spatial Reasoning

Add code
Mar 27, 2026
Viaarxiv icon

Geometry-Aware Rotary Position Embedding for Consistent Video World Model

Add code
Feb 08, 2026
Viaarxiv icon

MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling

Add code
Nov 18, 2025
Viaarxiv icon

C4D: 4D Made from 3D through Dual Correspondences

Add code
Oct 16, 2025
Viaarxiv icon

WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation

Add code
Oct 08, 2025
Viaarxiv icon

Query-Kontext: An Unified Multimodal Model for Image Generation and Editing

Add code
Sep 30, 2025
Figure 1 for Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
Figure 2 for Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
Figure 3 for Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
Figure 4 for Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
Viaarxiv icon

Test3R: Learning to Reconstruct 3D at Test Time

Add code
Jun 16, 2025
Figure 1 for Test3R: Learning to Reconstruct 3D at Test Time
Figure 2 for Test3R: Learning to Reconstruct 3D at Test Time
Figure 3 for Test3R: Learning to Reconstruct 3D at Test Time
Figure 4 for Test3R: Learning to Reconstruct 3D at Test Time
Viaarxiv icon