Picture for Bocheng Chen

Bocheng Chen

Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models

Add code
Aug 10, 2026
Viaarxiv icon

Can Large Language Models Handle Discourse Particles? A Case Study of Colloquial Malay

Add code
May 27, 2026
Viaarxiv icon

Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment

Add code
Mar 12, 2026
Viaarxiv icon

Learning to Diagnose and Correct Moral Errors: Towards Enhancing Moral Sensitivity in Large Language Models

Add code
Jan 06, 2026
Viaarxiv icon

No Free Lunch for Defending Against Prefilling Attack by In-Context Learning

Add code
Dec 13, 2024
Viaarxiv icon

FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks

Add code
Dec 10, 2024
Figure 1 for FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
Figure 2 for FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
Figure 3 for FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
Figure 4 for FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
Viaarxiv icon

Protecting Activity Sensing Data Privacy Using Hierarchical Information Dissociation

Add code
Sep 04, 2024
Figure 1 for Protecting Activity Sensing Data Privacy Using Hierarchical Information Dissociation
Figure 2 for Protecting Activity Sensing Data Privacy Using Hierarchical Information Dissociation
Figure 3 for Protecting Activity Sensing Data Privacy Using Hierarchical Information Dissociation
Figure 4 for Protecting Activity Sensing Data Privacy Using Hierarchical Information Dissociation
Viaarxiv icon

The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs

Add code
Sep 01, 2024
Figure 1 for The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
Figure 2 for The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
Figure 3 for The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
Figure 4 for The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
Viaarxiv icon

Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems

Add code
Nov 20, 2023
Figure 1 for Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems
Figure 2 for Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems
Figure 3 for Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems
Figure 4 for Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems
Viaarxiv icon

PhantomSound: Black-Box, Query-Efficient Audio Adversarial Attack via Split-Second Phoneme Injection

Add code
Sep 13, 2023
Viaarxiv icon