Picture for Jiahua Bao

Jiahua Bao

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

Add code
Aug 04, 2026
Viaarxiv icon