Picture for Xuecheng Wu

Xuecheng Wu

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

Add code
Aug 11, 2026
Viaarxiv icon

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

Add code
Jul 31, 2026
Viaarxiv icon

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

Add code
Jun 24, 2026
Viaarxiv icon

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

Add code
Jun 22, 2026
Viaarxiv icon

MooD: An Efficient VA-Driven Affective Image Editing Framework via Fine-Grained Semantic Control

Add code
May 04, 2026
Viaarxiv icon

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

Add code
Apr 20, 2026
Viaarxiv icon

AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control

Add code
Apr 12, 2026
Viaarxiv icon

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

Add code
Apr 09, 2026
Viaarxiv icon

EPIR: An Efficient Patch Tokenization, Integration and Representation Framework for Micro-expression Recognition

Add code
Apr 09, 2026
Viaarxiv icon

TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning

Add code
Apr 01, 2026
Viaarxiv icon