Picture for Xiaoshan Yang

Xiaoshan Yang

UniFed-VLM: Federated Instruction Tuning for Vision-Language Models with Multiple Heterogeneity

Add code
Aug 16, 2026
Viaarxiv icon

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

Add code
Aug 07, 2026
Viaarxiv icon

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

Add code
Jul 24, 2026
Viaarxiv icon

VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation

Add code
Jul 16, 2026
Viaarxiv icon

Boosting Multimodal Federated Learning via Chained Modality Optimization

Add code
Jun 01, 2026
Viaarxiv icon

Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method

Add code
Mar 29, 2026
Viaarxiv icon

A Step Toward Federated Pretraining of Multimodal Large Language Models

Add code
Mar 25, 2026
Viaarxiv icon

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

Add code
Jan 31, 2026
Viaarxiv icon

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Add code
Jun 05, 2025
Viaarxiv icon

Harmony: A Unified Framework for Modality Incremental Learning

Add code
Apr 17, 2025
Viaarxiv icon