Picture for Gengsheng Li

Gengsheng Li

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

Add code
Aug 07, 2026
Viaarxiv icon

EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

Add code
Jul 13, 2026
Viaarxiv icon

On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

Add code
Jun 14, 2026
Viaarxiv icon

Visual-Advantage On-Policy Distillation for Vision-Language Models

Add code
May 21, 2026
Viaarxiv icon

Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

Add code
Apr 02, 2026
Viaarxiv icon

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

Add code
Feb 16, 2026
Viaarxiv icon