Picture for Lanjihong Ma

Lanjihong Ma

Selective Ensemble Based on Preference-Directed Multi-Objective Bandits

Add code
Jun 20, 2026
Viaarxiv icon

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

Add code
May 06, 2026
Viaarxiv icon