Picture for Zijun Xie

Zijun Xie

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

Add code
Jul 30, 2026
Viaarxiv icon

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

Add code
Jul 24, 2026
Viaarxiv icon

ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

Add code
Jul 03, 2026
Viaarxiv icon

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

Add code
Jun 30, 2026
Viaarxiv icon