Picture for Jinda Lu

Jinda Lu

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

Add code
Jul 11, 2026
Viaarxiv icon

Experience Augmented Policy Optimization for LLM Reasoning

Add code
Jun 29, 2026
Viaarxiv icon

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

Add code
May 21, 2026
Viaarxiv icon

One-Way Policy Optimization for Self-Evolving LLMs

Add code
May 21, 2026
Viaarxiv icon

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

Add code
Mar 27, 2026
Viaarxiv icon

Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs

Add code
Mar 26, 2026
Viaarxiv icon

On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation

Add code
Mar 23, 2026
Viaarxiv icon

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

Add code
Mar 20, 2026
Viaarxiv icon

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

Add code
Feb 26, 2026
Viaarxiv icon

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

Add code
Jan 07, 2026
Viaarxiv icon