Picture for Xiangyu Zeng

Xiangyu Zeng

CertBind from Multimodal Connectivity to Certifiable Retrieval Decisions

Add code
Aug 06, 2026
Viaarxiv icon

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Add code
Jul 19, 2026
Viaarxiv icon

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

Add code
Jul 16, 2026
Viaarxiv icon

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Add code
Jul 16, 2026
Viaarxiv icon

DOPD: Dual On-policy Distillation

Add code
Jun 29, 2026
Viaarxiv icon

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

Add code
May 25, 2026
Viaarxiv icon

Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing

Add code
Apr 22, 2026
Viaarxiv icon

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

Add code
Mar 24, 2026
Viaarxiv icon

HiCI: Hierarchical Construction-Integration for Long-Context Attention

Add code
Mar 21, 2026
Viaarxiv icon

RIVER: A Real-Time Interaction Benchmark for Video LLMs

Add code
Mar 04, 2026
Viaarxiv icon