Picture for Quynh Vo

Quynh Vo

DynaPix: Can Vision-Language Models Identify the Exact Future?

Add code
Aug 06, 2026
Viaarxiv icon

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

Add code
Aug 05, 2026
Viaarxiv icon

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

Add code
Jul 13, 2026
Viaarxiv icon

TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

Add code
Jul 13, 2026
Viaarxiv icon