Picture for Xiaodan Liang

Xiaodan Liang

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

Add code
Aug 05, 2026
Viaarxiv icon

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

Add code
Jul 22, 2026
Viaarxiv icon

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

Add code
Jul 21, 2026
Viaarxiv icon

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

Add code
Jul 13, 2026
Viaarxiv icon

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

Add code
Jun 29, 2026
Viaarxiv icon

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

Add code
Jun 26, 2026
Viaarxiv icon

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

Add code
Jun 25, 2026
Viaarxiv icon

Latent Visual States for Efficient Multimodal Reasoning

Add code
Jun 23, 2026
Viaarxiv icon

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

Add code
Jun 22, 2026
Viaarxiv icon

iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

Add code
May 20, 2026
Viaarxiv icon