Picture for Hejian Sang

Hejian Sang

TREK: Distill to Explore, Reinforce to Refine

Add code
Jul 06, 2026
Viaarxiv icon

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

Add code
Jun 30, 2026
Viaarxiv icon

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

Add code
May 14, 2026
Viaarxiv icon

TIP: Token Importance in On-Policy Distillation

Add code
Apr 15, 2026
Viaarxiv icon

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

Add code
Apr 04, 2026
Viaarxiv icon

PACED: Distillation and Self-Distillation at the Frontier of Student Competence

Add code
Mar 16, 2026
Viaarxiv icon

PACED: Distillation at the Frontier of Student Competence

Add code
Mar 11, 2026
Viaarxiv icon

On-Policy Self-Distillation for Reasoning Compression

Add code
Mar 05, 2026
Viaarxiv icon

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

Add code
Feb 24, 2026
Viaarxiv icon

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

Add code
Feb 03, 2026
Viaarxiv icon