Picture for Dewen Fan

Dewen Fan

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

Add code
Aug 20, 2026
Viaarxiv icon

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

Add code
Jul 02, 2026
Viaarxiv icon

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

Add code
May 12, 2026
Viaarxiv icon

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

Add code
Mar 20, 2026
Viaarxiv icon

EVLM: An Efficient Vision-Language Model for Visual Understanding

Add code
Jul 19, 2024
Figure 1 for EVLM: An Efficient Vision-Language Model for Visual Understanding
Figure 2 for EVLM: An Efficient Vision-Language Model for Visual Understanding
Figure 3 for EVLM: An Efficient Vision-Language Model for Visual Understanding
Figure 4 for EVLM: An Efficient Vision-Language Model for Visual Understanding
Viaarxiv icon

Improving Crowded Object Detection via Copy-Paste

Add code
Nov 22, 2022
Figure 1 for Improving Crowded Object Detection via Copy-Paste
Figure 2 for Improving Crowded Object Detection via Copy-Paste
Figure 3 for Improving Crowded Object Detection via Copy-Paste
Figure 4 for Improving Crowded Object Detection via Copy-Paste
Viaarxiv icon