Picture for Haoxuan Che

Haoxuan Che

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

Add code
Aug 13, 2026
Viaarxiv icon

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

Add code
Aug 03, 2026
Viaarxiv icon

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

Add code
Jul 26, 2026
Viaarxiv icon

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

Add code
Jul 14, 2026
Viaarxiv icon

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

Add code
May 29, 2026
Viaarxiv icon

Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

Add code
May 12, 2026
Viaarxiv icon

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

Add code
Apr 24, 2026
Viaarxiv icon

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

Add code
Apr 09, 2026
Viaarxiv icon

VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

Add code
Dec 22, 2025
Viaarxiv icon

MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement

Add code
Dec 17, 2025
Viaarxiv icon