Picture for Wenbo Hu

Wenbo Hu

Visual Token Compression Enhances Robustness of MLLMs

Add code
Jul 21, 2026
Viaarxiv icon

G$^2$TAM: Geometry Grounded Track Anything Model

Add code
Jul 04, 2026
Viaarxiv icon

RayPE: Ray-Space Positional Encoding for 3D-Aware Video Generation

Add code
Jun 25, 2026
Viaarxiv icon

Pixal3D: Pixel-Aligned 3D Generation from Images

Add code
May 11, 2026
Viaarxiv icon

Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

Add code
Apr 23, 2026
Viaarxiv icon

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

Add code
Apr 09, 2026
Viaarxiv icon

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Add code
Apr 01, 2026
Viaarxiv icon

Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels

Add code
Mar 05, 2026
Viaarxiv icon

MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE

Add code
Feb 09, 2026
Viaarxiv icon

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

Add code
Jan 08, 2026
Viaarxiv icon