Picture for Zewen Ding

Zewen Ding

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

Add code
Jun 15, 2026
Viaarxiv icon

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

Add code
Jan 07, 2026
Viaarxiv icon