Picture for Samuele Vinanzi

Samuele Vinanzi

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

Add code
Jul 31, 2026
Viaarxiv icon