Picture for William Hackett

William Hackett

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

Add code
Jul 02, 2026
Viaarxiv icon

Bypassing Prompt Injection and Jailbreak Detection in LLM Guardrails

Add code
Apr 16, 2025
Viaarxiv icon

Compilation as a Defense: Enhancing DL Model Attack Robustness via Tensor Optimization

Add code
Sep 20, 2023
Figure 1 for Compilation as a Defense: Enhancing DL Model Attack Robustness via Tensor Optimization
Viaarxiv icon

Model Leeching: An Extraction Attack Targeting LLMs

Add code
Sep 19, 2023
Viaarxiv icon

PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models

Add code
Sep 13, 2022
Figure 1 for PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models
Figure 2 for PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models
Figure 3 for PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models
Figure 4 for PINCH: An Adversarial Extraction Attack Framework for Deep Learning Models
Viaarxiv icon