Picture for Anil Ramakrishna

Anil Ramakrishna

From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

Add code
Aug 11, 2026
Viaarxiv icon

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

Add code
Jul 28, 2026
Viaarxiv icon

Tokenizing Numerical and Embedding Features for LLM RecSys

Add code
Jul 10, 2026
Viaarxiv icon

Detecting Functional Memorization in Code Language Models

Add code
Jun 11, 2026
Viaarxiv icon

SWAN: Semantic Watermarking with Abstract Meaning Representation

Add code
May 05, 2026
Viaarxiv icon

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

Add code
Mar 23, 2026
Viaarxiv icon

From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs

Add code
Nov 18, 2025
Figure 1 for From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
Figure 2 for From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
Figure 3 for From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
Figure 4 for From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
Viaarxiv icon

BLUR: A Bi-Level Optimization Approach for LLM Unlearning

Add code
Jun 09, 2025
Viaarxiv icon

Constrained Entropic Unlearning: A Primal-Dual Framework for Large Language Models

Add code
Jun 05, 2025
Viaarxiv icon

Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation

Add code
May 27, 2025
Viaarxiv icon