Picture for Zhijie Xia

Zhijie Xia

ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning

Add code
Jul 27, 2026
Viaarxiv icon