Picture for Mengnan Zhao

Mengnan Zhao

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

Add code
Aug 11, 2026
Viaarxiv icon

Confusion-Geometry Rebalancing for Long-Tailed Adversarial Training

Add code
Aug 10, 2026
Viaarxiv icon

AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents

Add code
Jul 29, 2026
Viaarxiv icon

Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training

Add code
Apr 27, 2026
Viaarxiv icon

Mitigating Error Amplification in Fast Adversarial Training

Add code
Apr 27, 2026
Viaarxiv icon

Tagging-Augmented Generation: Assisting Language Models in Finding Intricate Knowledge In Long Contexts

Add code
Oct 27, 2025
Viaarxiv icon

BadPromptFL: A Novel Backdoor Threat to Prompt-based Federated Learning in Multimodal Models

Add code
Aug 11, 2025
Viaarxiv icon

AdvAnchor: Enhancing Diffusion Model Unlearning with Adversarial Anchors

Add code
Dec 28, 2024
Viaarxiv icon

Adversarial Training: A Survey

Add code
Oct 19, 2024
Figure 1 for Adversarial Training: A Survey
Figure 2 for Adversarial Training: A Survey
Figure 3 for Adversarial Training: A Survey
Figure 4 for Adversarial Training: A Survey
Viaarxiv icon

Catastrophic Overfitting: A Potential Blessing in Disguise

Add code
Feb 28, 2024
Viaarxiv icon