Picture for Perry Dong

Perry Dong

Q-Learning With World Models

Add code
Aug 17, 2026
Viaarxiv icon

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

Add code
Jul 29, 2026
Viaarxiv icon

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

Add code
May 25, 2026
Viaarxiv icon

FASTER: Value-Guided Sampling for Fast RL

Add code
Apr 21, 2026
Viaarxiv icon

TQL: Scaling Q-Functions with Transformers by Preventing Attention Collapse

Add code
Feb 01, 2026
Viaarxiv icon

Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning

Add code
Dec 18, 2025
Viaarxiv icon

EXPO: Stable Reinforcement Learning with Expressive Policies

Add code
Jul 10, 2025
Viaarxiv icon

Reinforcement Learning via Implicit Imitation Guidance

Add code
Jun 09, 2025
Viaarxiv icon

What Matters for Batch Online Reinforcement Learning in Robotics?

Add code
May 12, 2025
Viaarxiv icon

Adaptively Learning to Select-Rank in Online Platforms

Add code
Jun 07, 2024
Figure 1 for Adaptively Learning to Select-Rank in Online Platforms
Figure 2 for Adaptively Learning to Select-Rank in Online Platforms
Figure 3 for Adaptively Learning to Select-Rank in Online Platforms
Figure 4 for Adaptively Learning to Select-Rank in Online Platforms
Viaarxiv icon