Picture for Athanasios Glentis

Athanasios Glentis

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

Add code
Jul 01, 2026
Viaarxiv icon

EMA-Nesterov: Stabilizing Nesterov's Lookahead for Accelerated Deep Learning Optimization

Add code
May 25, 2026
Viaarxiv icon

Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking

Add code
May 28, 2025
Figure 1 for Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
Figure 2 for Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
Figure 3 for Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
Figure 4 for Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
Viaarxiv icon