Picture for Wenkui Fan

Wenkui Fan

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

Add code
Aug 04, 2026
Viaarxiv icon