Picture for Yifu Huo

Yifu Huo

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

Add code
Aug 08, 2026
Viaarxiv icon

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

Add code
Aug 06, 2026
Viaarxiv icon

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

Add code
Mar 26, 2026
Viaarxiv icon

When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning

Add code
Feb 28, 2026
Viaarxiv icon

APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards

Add code
Jan 31, 2026
Viaarxiv icon

SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams

Add code
Jan 14, 2026
Viaarxiv icon

Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models

Add code
Nov 16, 2025
Viaarxiv icon

HEAL: A Hypothesis-Based Preference-Aware Analysis Framework

Add code
Aug 27, 2025
Figure 1 for HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
Figure 2 for HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
Figure 3 for HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
Figure 4 for HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
Viaarxiv icon

LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination

Add code
Aug 26, 2025
Viaarxiv icon

GRAM: A Generative Foundation Reward Model for Reward Generalization

Add code
Jun 18, 2025
Viaarxiv icon