Picture for Xuemeng Song

Xuemeng Song

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

Add code
Aug 04, 2026
Viaarxiv icon

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

Add code
Jul 30, 2026
Viaarxiv icon

Diverse-Intent Multi-Turn Fashion Image Retrieval

Add code
Jul 22, 2026
Viaarxiv icon

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations

Add code
Jun 03, 2026
Viaarxiv icon

FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

Add code
May 21, 2026
Viaarxiv icon

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Add code
May 20, 2026
Viaarxiv icon

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

Add code
Apr 22, 2026
Viaarxiv icon

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

Add code
Mar 31, 2026
Viaarxiv icon

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

Add code
Feb 08, 2026
Viaarxiv icon

Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems

Add code
Sep 09, 2025
Figure 1 for Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
Figure 2 for Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
Figure 3 for Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
Figure 4 for Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
Viaarxiv icon