Picture for Xingyu Fu

Xingyu Fu

Context-Aware RL for Agentic and Multimodal LLMs

Add code
Jun 15, 2026
Viaarxiv icon

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

Add code
Jun 04, 2026
Viaarxiv icon

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

Add code
Apr 10, 2026
Viaarxiv icon

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

Add code
Mar 20, 2026
Viaarxiv icon

Reinforced Attention Learning

Add code
Feb 04, 2026
Viaarxiv icon

UEval: A Benchmark for Unified Multimodal Generation

Add code
Jan 29, 2026
Viaarxiv icon

Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

Add code
Sep 26, 2025
Viaarxiv icon

FormCoach: Lift Smarter, Not Harder

Add code
Aug 10, 2025
Viaarxiv icon

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Add code
Apr 17, 2025
Viaarxiv icon

ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding

Add code
Jan 09, 2025
Figure 1 for ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
Figure 2 for ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
Figure 3 for ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
Figure 4 for ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
Viaarxiv icon