Picture for Qiaozhi He

Qiaozhi He

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

Add code
Aug 08, 2026
Viaarxiv icon

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

Add code
Aug 06, 2026
Viaarxiv icon

DrawMotion: Generating 3D Human Motions by Freehand Drawing

Add code
May 20, 2026
Viaarxiv icon

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

Add code
Mar 26, 2026
Viaarxiv icon

DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering

Add code
Mar 19, 2026
Viaarxiv icon

When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning

Add code
Feb 28, 2026
Viaarxiv icon

APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards

Add code
Jan 31, 2026
Viaarxiv icon

SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams

Add code
Jan 14, 2026
Viaarxiv icon

Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models

Add code
Nov 16, 2025
Viaarxiv icon

GRAM: A Generative Foundation Reward Model for Reward Generalization

Add code
Jun 18, 2025
Viaarxiv icon