Picture for Florian Mai

Florian Mai

Idiap Research Institute, EPFL

Data Attribution of Emergent Misalignment with Persona Features

Add code
Aug 11, 2026
Viaarxiv icon

A Unified Moral-Value Dataset for Instruction Tuning

Add code
Jul 23, 2026
Viaarxiv icon

Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards

Add code
May 29, 2026
Viaarxiv icon

Reasoning Primitives in Hybrid and Non-Hybrid LLMs

Add code
Apr 23, 2026
Viaarxiv icon

Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi

Add code
Mar 03, 2026
Viaarxiv icon

Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models

Add code
Feb 25, 2026
Viaarxiv icon

IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation

Add code
Oct 23, 2025
Viaarxiv icon

In-Training Defenses against Emergent Misalignment in Language Models

Add code
Aug 08, 2025
Viaarxiv icon

Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models

Add code
May 28, 2025
Figure 1 for Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Figure 2 for Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Figure 3 for Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Figure 4 for Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Viaarxiv icon

Superalignment with Dynamic Human Values

Add code
Mar 17, 2025
Figure 1 for Superalignment with Dynamic Human Values
Figure 2 for Superalignment with Dynamic Human Values
Viaarxiv icon