Picture for Atli Kosson

Atli Kosson

Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors

Add code
Jun 24, 2026
Viaarxiv icon

Weight Decay may matter more than muP for Learning Rate Transfer in Practice

Add code
Oct 21, 2025
Viaarxiv icon

Analyzing & Reducing the Need for Learning Rate Warmup in GPT Training

Add code
Oct 31, 2024
Viaarxiv icon

Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations

Add code
May 29, 2024
Figure 1 for Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations
Figure 2 for Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations
Figure 3 for Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations
Figure 4 for Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations
Viaarxiv icon

Memory Efficient Mixed-Precision Optimizers

Add code
Sep 21, 2023
Viaarxiv icon

Rotational Optimizers: Simple & Robust DNN Training

Add code
May 26, 2023
Figure 1 for Rotational Optimizers: Simple & Robust DNN Training
Figure 2 for Rotational Optimizers: Simple & Robust DNN Training
Figure 3 for Rotational Optimizers: Simple & Robust DNN Training
Figure 4 for Rotational Optimizers: Simple & Robust DNN Training
Viaarxiv icon

Hardware-Efficient Transformer Training via Piecewise Affine Operations

Add code
May 26, 2023
Viaarxiv icon

Ghost Noise for Regularizing Deep Neural Networks

Add code
May 26, 2023
Viaarxiv icon

Adaptive Braking for Mitigating Gradient Delay

Add code
Jul 10, 2020
Figure 1 for Adaptive Braking for Mitigating Gradient Delay
Figure 2 for Adaptive Braking for Mitigating Gradient Delay
Figure 3 for Adaptive Braking for Mitigating Gradient Delay
Figure 4 for Adaptive Braking for Mitigating Gradient Delay
Viaarxiv icon

Pipelined Backpropagation at Scale: Training Large Models without Batches

Add code
Mar 25, 2020
Figure 1 for Pipelined Backpropagation at Scale: Training Large Models without Batches
Figure 2 for Pipelined Backpropagation at Scale: Training Large Models without Batches
Figure 3 for Pipelined Backpropagation at Scale: Training Large Models without Batches
Figure 4 for Pipelined Backpropagation at Scale: Training Large Models without Batches
Viaarxiv icon