Picture for Jiannan Ge

Jiannan Ge

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

Add code
Jul 10, 2026
Viaarxiv icon

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

Add code
Jul 02, 2026
Viaarxiv icon

SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Add code
Mar 18, 2025
Figure 1 for SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
Figure 2 for SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
Figure 3 for SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
Figure 4 for SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
Viaarxiv icon

AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation

Add code
Apr 08, 2024
Viaarxiv icon

Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval

Add code
Dec 19, 2023
Figure 1 for Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval
Figure 2 for Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval
Figure 3 for Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval
Figure 4 for Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval
Viaarxiv icon

Dual-Stream Knowledge-Preserving Hashing for Unsupervised Video Retrieval

Add code
Oct 12, 2023
Viaarxiv icon

Balanced Classification: A Unified Framework for Long-Tailed Object Detection

Add code
Aug 04, 2023
Viaarxiv icon