Picture for Andrew Mack

Andrew Mack

Scaling Interpretable Transformers with Parity Bottleneck Layers

Add code
Jul 22, 2026
Viaarxiv icon

Mechanistically Eliciting Latent Behaviors in Language Models

Add code
Jun 28, 2026
Viaarxiv icon

Towards Worst-Case Guarantees with Scale-Aware Interpretability

Add code
Feb 05, 2026
Viaarxiv icon