Picture for Jihwan Oh

Jihwan Oh

Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

Add code
Aug 03, 2026
Viaarxiv icon

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

Add code
Apr 10, 2026
Viaarxiv icon

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

Add code
Feb 12, 2026
Viaarxiv icon

LLM Agents for Bargaining with Utility-based Feedback

Add code
May 29, 2025
Viaarxiv icon

ReFeed: Multi-dimensional Summarization Refinement with Reflective Reasoning on Feedback

Add code
Mar 27, 2025
Viaarxiv icon

When Debate Fails: Bias Reinforcement in Large Language Models

Add code
Mar 21, 2025
Figure 1 for When Debate Fails: Bias Reinforcement in Large Language Models
Figure 2 for When Debate Fails: Bias Reinforcement in Large Language Models
Figure 3 for When Debate Fails: Bias Reinforcement in Large Language Models
Figure 4 for When Debate Fails: Bias Reinforcement in Large Language Models
Viaarxiv icon

Learning to Verify Summary Facts with Fine-Grained LLM Feedback

Add code
Dec 14, 2024
Figure 1 for Learning to Verify Summary Facts with Fine-Grained LLM Feedback
Figure 2 for Learning to Verify Summary Facts with Fine-Grained LLM Feedback
Figure 3 for Learning to Verify Summary Facts with Fine-Grained LLM Feedback
Figure 4 for Learning to Verify Summary Facts with Fine-Grained LLM Feedback
Viaarxiv icon

Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning

Add code
Aug 23, 2024
Figure 1 for Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
Figure 2 for Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
Figure 3 for Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
Figure 4 for Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
Viaarxiv icon

Preference Alignment with Flow Matching

Add code
May 30, 2024
Figure 1 for Preference Alignment with Flow Matching
Figure 2 for Preference Alignment with Flow Matching
Figure 3 for Preference Alignment with Flow Matching
Figure 4 for Preference Alignment with Flow Matching
Viaarxiv icon

Toward Risk-based Optimistic Exploration for Cooperative Multi-Agent Reinforcement Learning

Add code
Mar 03, 2023
Viaarxiv icon