Picture for Tu Yongsiqi

Tu Yongsiqi

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

Add code
Aug 04, 2026
Viaarxiv icon