Picture for Brett Daley

Brett Daley

Gated Q-learning: Add Off-Policy Bias to Taste

Add code
Jul 31, 2026
Viaarxiv icon

Accelerating Q-learning through Efficient Value-Sharing across Actions

Add code
Jun 29, 2026
Viaarxiv icon

On Centralized Critics in Multi-Agent Reinforcement Learning

Add code
Aug 26, 2024
Figure 1 for On Centralized Critics in Multi-Agent Reinforcement Learning
Figure 2 for On Centralized Critics in Multi-Agent Reinforcement Learning
Figure 3 for On Centralized Critics in Multi-Agent Reinforcement Learning
Figure 4 for On Centralized Critics in Multi-Agent Reinforcement Learning
Viaarxiv icon

Demystifying the Recency Heuristic in Temporal-Difference Learning

Add code
Jun 18, 2024
Figure 1 for Demystifying the Recency Heuristic in Temporal-Difference Learning
Figure 2 for Demystifying the Recency Heuristic in Temporal-Difference Learning
Figure 3 for Demystifying the Recency Heuristic in Temporal-Difference Learning
Figure 4 for Demystifying the Recency Heuristic in Temporal-Difference Learning
Viaarxiv icon

Compound Returns Reduce Variance in Reinforcement Learning

Add code
Feb 06, 2024
Figure 1 for Compound Returns Reduce Variance in Reinforcement Learning
Figure 2 for Compound Returns Reduce Variance in Reinforcement Learning
Figure 3 for Compound Returns Reduce Variance in Reinforcement Learning
Figure 4 for Compound Returns Reduce Variance in Reinforcement Learning
Viaarxiv icon

Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning

Add code
Jan 26, 2023
Figure 1 for Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning
Figure 2 for Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning
Figure 3 for Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning
Figure 4 for Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning
Viaarxiv icon

Adaptive Tree Backup Algorithms for Temporal-Difference Reinforcement Learning

Add code
Jun 04, 2022
Figure 1 for Adaptive Tree Backup Algorithms for Temporal-Difference Reinforcement Learning
Viaarxiv icon

Improving the Efficiency of Off-Policy Reinforcement Learning by Accounting for Past Decisions

Add code
Dec 23, 2021
Viaarxiv icon

Virtual Replay Cache

Add code
Dec 06, 2021
Figure 1 for Virtual Replay Cache
Figure 2 for Virtual Replay Cache
Figure 3 for Virtual Replay Cache
Figure 4 for Virtual Replay Cache
Viaarxiv icon

Human-Level Control without Server-Grade Hardware

Add code
Nov 01, 2021
Figure 1 for Human-Level Control without Server-Grade Hardware
Figure 2 for Human-Level Control without Server-Grade Hardware
Figure 3 for Human-Level Control without Server-Grade Hardware
Figure 4 for Human-Level Control without Server-Grade Hardware
Viaarxiv icon