Picture for Yuhao Liao

Yuhao Liao

On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards

Add code
Jul 25, 2026
Viaarxiv icon

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

Add code
Mar 29, 2026
Viaarxiv icon