Picture for Martin Jaggi

Martin Jaggi

EPFL

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

Add code
Jul 20, 2026
Viaarxiv icon

Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping

Add code
Jun 29, 2026
Viaarxiv icon

Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors

Add code
Jun 24, 2026
Viaarxiv icon

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

Add code
Jun 15, 2026
Viaarxiv icon

Local MixVR: Breaking the Communication-Sample Dependence in Distributed Learning

Add code
May 31, 2026
Viaarxiv icon

Apertus LLM Family Expansion via Distillation and Quantization

Add code
May 27, 2026
Viaarxiv icon

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

Add code
Apr 22, 2026
Viaarxiv icon

Weight Decay may matter more than muP for Learning Rate Transfer in Practice

Add code
Oct 21, 2025
Viaarxiv icon

Apertus: Democratizing Open and Compliant LLMs for Global Language Environments

Add code
Sep 17, 2025
Figure 1 for Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
Figure 2 for Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
Figure 3 for Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
Figure 4 for Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
Viaarxiv icon

TiMoE: Time-Aware Mixture of Language Experts

Add code
Aug 12, 2025
Figure 1 for TiMoE: Time-Aware Mixture of Language Experts
Figure 2 for TiMoE: Time-Aware Mixture of Language Experts
Figure 3 for TiMoE: Time-Aware Mixture of Language Experts
Figure 4 for TiMoE: Time-Aware Mixture of Language Experts
Viaarxiv icon