Picture for Alborz Geramifard

Alborz Geramifard

TREK: Distill to Explore, Reinforce to Refine

Add code
Jul 06, 2026
Viaarxiv icon

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

Add code
Jun 30, 2026
Viaarxiv icon

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

Add code
May 14, 2026
Viaarxiv icon

TIP: Token Importance in On-Policy Distillation

Add code
Apr 15, 2026
Viaarxiv icon

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

Add code
Apr 04, 2026
Viaarxiv icon

Sequential Decision-Making for Inline Text Autocomplete

Add code
Mar 21, 2024
Viaarxiv icon

Score Models for Offline Goal-Conditioned Reinforcement Learning

Add code
Nov 03, 2023
Viaarxiv icon

Sequence Modeling is a Robust Contender for Offline Reinforcement Learning

Add code
May 26, 2023
Viaarxiv icon

Curriculum Script Distillation for Multilingual Visual Question Answering

Add code
Jan 17, 2023
Viaarxiv icon

Navigating Connected Memories with a Task-oriented Dialog System

Add code
Nov 15, 2022
Figure 1 for Navigating Connected Memories with a Task-oriented Dialog System
Figure 2 for Navigating Connected Memories with a Task-oriented Dialog System
Figure 3 for Navigating Connected Memories with a Task-oriented Dialog System
Figure 4 for Navigating Connected Memories with a Task-oriented Dialog System
Viaarxiv icon