Picture for Aviral Kumar

Aviral Kumar

MIRROR: Learning from the Other View for Multi-Modal Reasoning

Add code
Jul 23, 2026
Viaarxiv icon

Addressing Over-Refusal in LLMs with Competing Rewards

Add code
Jun 30, 2026
Viaarxiv icon

ExpRL: Exploratory RL for LLM Mid-Training

Add code
Jun 15, 2026
Viaarxiv icon

AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents

Add code
Jun 04, 2026
Viaarxiv icon

Recursive Agent Optimization

Add code
May 07, 2026
Viaarxiv icon

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

Add code
Apr 06, 2026
Viaarxiv icon

IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL

Add code
Mar 12, 2026
Viaarxiv icon

What Does Flow Matching Bring To TD Learning?

Add code
Mar 04, 2026
Viaarxiv icon

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

Add code
Feb 16, 2026
Viaarxiv icon

Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL

Add code
Feb 03, 2026
Viaarxiv icon