Picture for Limin Wang

Limin Wang

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

Add code
Jul 22, 2026
Viaarxiv icon

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Add code
Jul 19, 2026
Viaarxiv icon

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Add code
Jul 16, 2026
Viaarxiv icon

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

Add code
Jul 16, 2026
Viaarxiv icon

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

Add code
Jun 24, 2026
Viaarxiv icon

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

Add code
Jun 15, 2026
Viaarxiv icon

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

Add code
Jun 11, 2026
Viaarxiv icon

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

Add code
Jun 10, 2026
Viaarxiv icon

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

Add code
Jun 10, 2026
Viaarxiv icon

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

Add code
Jun 01, 2026
Viaarxiv icon