Picture for Ruize Han

Ruize Han

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

Add code
Jul 28, 2026
Viaarxiv icon

Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground Platforms

Add code
Jul 26, 2026
Viaarxiv icon

Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

Add code
Jul 17, 2026
Viaarxiv icon

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Add code
Jun 18, 2026
Viaarxiv icon

ExDet: Open-Domain Open-Vocabulary Detection with Cross-modal Extrapolation and Rectification

Add code
Jun 08, 2026
Viaarxiv icon

RT-SDGOD: Real-Time Single-Domain Generalized Object Detection

Add code
Jun 08, 2026
Viaarxiv icon

IMWM: Intuition Models Complement World Models for Latent Planning

Add code
Jun 01, 2026
Viaarxiv icon

LV-OSD: Language-Vision-Complementary Open-Set Object Detection

Add code
May 27, 2026
Viaarxiv icon

COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection

Add code
May 26, 2026
Viaarxiv icon

The First Challenge on Remote Sensing Infrared Image Super-Resolution at NTIRE 2026: Benchmark Results and Method Overview

Add code
Apr 23, 2026
Viaarxiv icon