Picture for David Demitri Africa

David Demitri Africa

UK AI Security Institute

Item Response Theory for AI Safety

Add code
Aug 05, 2026
Viaarxiv icon

Detecting CSAM Text-to-Image LoRAs From Weights

Add code
Jul 28, 2026
Viaarxiv icon

Persona Cartography: Charting Language Model Personality Traits in Weight Space

Add code
Jul 08, 2026
Viaarxiv icon

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

Add code
Jun 25, 2026
Viaarxiv icon

PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

Add code
Jun 13, 2026
Viaarxiv icon

Prefill Awareness in Large Language Models

Add code
Jun 10, 2026
Viaarxiv icon

Consistency Training Along the Transformer Stack

Add code
Jun 04, 2026
Viaarxiv icon

Consistency Training Can Entrench Misalignment

Add code
Jun 03, 2026
Viaarxiv icon

Consistency Training while Mitigating Obfuscation via Rate Matching

Add code
Jun 01, 2026
Viaarxiv icon

Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time

Add code
Oct 05, 2025
Figure 1 for Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
Figure 2 for Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
Figure 3 for Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
Figure 4 for Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
Viaarxiv icon