Picture for Tao Huang

Tao Huang

Traj-LeWM: Path-Aware World-Model Planning via Latent Trajectory Cost

Add code
Aug 14, 2026
Viaarxiv icon

Foresight Without Seeing: Latent Futures for World Action Models

Add code
Aug 12, 2026
Viaarxiv icon

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

Add code
Aug 12, 2026
Viaarxiv icon

WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

Add code
Aug 10, 2026
Viaarxiv icon

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

Add code
Aug 05, 2026
Viaarxiv icon

LocAnyMed: Vision-Language Grounding for Multimodal Medical Images

Add code
Aug 04, 2026
Viaarxiv icon

GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

Add code
Jul 27, 2026
Viaarxiv icon

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

Add code
Jul 17, 2026
Viaarxiv icon

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

Add code
Jun 30, 2026
Viaarxiv icon

Kairos: A Native World Model Stack for Physical AI

Add code
Jun 16, 2026
Viaarxiv icon