Picture for Zezhong Tan

Zezhong Tan

I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization

Add code
Aug 13, 2026
Viaarxiv icon

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

Add code
Dec 15, 2025
Figure 1 for ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
Figure 2 for ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
Figure 3 for ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
Figure 4 for ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
Viaarxiv icon