Picture for Liangsheng Zhu

Liangsheng Zhu

ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning

Add code
Jul 27, 2026
Viaarxiv icon