Picture for Amrit Singh Bedi

Amrit Singh Bedi

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

Add code
Jul 01, 2026
Viaarxiv icon

Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

Add code
Jun 09, 2026
Viaarxiv icon

The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

Add code
Jun 08, 2026
Viaarxiv icon

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

Add code
May 25, 2026
Viaarxiv icon

RL with Learnable Textual Feedback: A Bilevel Approach

Add code
May 23, 2026
Viaarxiv icon

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

Add code
Mar 26, 2026
Viaarxiv icon

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

Add code
Feb 26, 2026
Viaarxiv icon

Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away

Add code
Feb 11, 2026
Viaarxiv icon

AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability

Add code
Jan 27, 2026
Viaarxiv icon

Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts

Add code
Oct 06, 2025
Figure 1 for Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
Figure 2 for Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
Figure 3 for Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
Figure 4 for Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
Viaarxiv icon