Picture for Zhengxi Lu

Zhengxi Lu

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Add code
Aug 06, 2026
Viaarxiv icon

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

Add code
Aug 06, 2026
Viaarxiv icon

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

Add code
Aug 01, 2026
Viaarxiv icon

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

Add code
Jul 30, 2026
Viaarxiv icon

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

Add code
Jul 29, 2026
Viaarxiv icon

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Add code
Jul 16, 2026
Viaarxiv icon

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

Add code
Jun 25, 2026
Viaarxiv icon

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

Add code
Jun 22, 2026
Viaarxiv icon

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

Add code
May 27, 2026
Viaarxiv icon

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Add code
May 21, 2026
Viaarxiv icon