Picture for Rahul Gupta

Rahul Gupta

From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

Add code
Aug 11, 2026
Viaarxiv icon

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

Add code
Jul 13, 2026
Viaarxiv icon

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

Add code
Jun 29, 2026
Viaarxiv icon

SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction

Add code
Jun 01, 2026
Viaarxiv icon

PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

Add code
May 29, 2026
Viaarxiv icon

DECOR: Auditing LLM Deception via Information Manipulation Theory

Add code
May 19, 2026
Viaarxiv icon

SWAN: Semantic Watermarking with Abstract Meaning Representation

Add code
May 05, 2026
Viaarxiv icon

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

Add code
Apr 20, 2026
Viaarxiv icon

Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition

Add code
Apr 20, 2026
Viaarxiv icon

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

Add code
Mar 23, 2026
Viaarxiv icon