Picture for Pontus Stenetorp

Pontus Stenetorp

AIMO Interpretability Challenge

Add code
Jul 15, 2026
Viaarxiv icon

Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

Add code
Jun 04, 2026
Viaarxiv icon

AIRA_2: Overcoming Bottlenecks in AI Research Agents

Add code
Mar 27, 2026
Viaarxiv icon

ShapleyLaw: A Game-Theoretic Approach to Multilingual Scaling Laws

Add code
Mar 18, 2026
Viaarxiv icon

The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining

Add code
Jan 01, 2026
Viaarxiv icon

Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation

Add code
Oct 02, 2025
Figure 1 for Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
Figure 2 for Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
Figure 3 for Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
Figure 4 for Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
Viaarxiv icon

Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification

Add code
Sep 17, 2025
Figure 1 for Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
Figure 2 for Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
Figure 3 for Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
Figure 4 for Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
Viaarxiv icon

AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench

Add code
Jul 03, 2025
Viaarxiv icon

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

Add code
Jun 08, 2025
Viaarxiv icon

SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?

Add code
Jun 05, 2025
Figure 1 for SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
Figure 2 for SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
Figure 3 for SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
Figure 4 for SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
Viaarxiv icon