Picture for Jiarui Yao

Jiarui Yao

SceneActBench: Can Agents Act on the 3D Scenes They See?

Add code
Jul 24, 2026
Viaarxiv icon

Predictive Divergence Masks for LLM RL

Add code
Jul 12, 2026
Viaarxiv icon

GRAIN: Group Aggregation via Min-Norm Objective

Add code
Jun 22, 2026
Viaarxiv icon

Rethinking the Divergence Regularization in LLM RL

Add code
Jun 08, 2026
Viaarxiv icon

AgentSPEX: An Agent SPecification and EXecution Language

Add code
Apr 14, 2026
Viaarxiv icon

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

Add code
Mar 14, 2026
Viaarxiv icon

PRL: Process Reward Learning Improves LLMs' Reasoning Ability and Broadens the Reasoning Boundary

Add code
Jan 15, 2026
Viaarxiv icon

ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning

Add code
Oct 14, 2025
Viaarxiv icon

Why is Your Language Model a Poor Implicit Reward Model?

Add code
Jul 10, 2025
Figure 1 for Why is Your Language Model a Poor Implicit Reward Model?
Figure 2 for Why is Your Language Model a Poor Implicit Reward Model?
Figure 3 for Why is Your Language Model a Poor Implicit Reward Model?
Figure 4 for Why is Your Language Model a Poor Implicit Reward Model?
Viaarxiv icon

MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

Add code
May 30, 2025
Viaarxiv icon