Picture for Shiwen Cui

Shiwen Cui

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

Add code
Jun 22, 2026
Viaarxiv icon

Constitutional On-Policy Safe Distillation

Add code
Jun 02, 2026
Viaarxiv icon

Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions

Add code
May 21, 2026
Viaarxiv icon

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

Add code
Mar 12, 2026
Viaarxiv icon

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

Add code
Oct 27, 2025
Viaarxiv icon

UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models

Add code
Oct 02, 2025
Figure 1 for UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
Figure 2 for UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
Figure 3 for UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
Figure 4 for UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
Viaarxiv icon

FragFake: A Dataset for Fine-Grained Detection of Edited Images with Vision Language Models

Add code
May 21, 2025
Figure 1 for FragFake: A Dataset for Fine-Grained Detection of Edited Images with Vision Language Models
Figure 2 for FragFake: A Dataset for Fine-Grained Detection of Edited Images with Vision Language Models
Figure 3 for FragFake: A Dataset for Fine-Grained Detection of Edited Images with Vision Language Models
Figure 4 for FragFake: A Dataset for Fine-Grained Detection of Edited Images with Vision Language Models
Viaarxiv icon

SEM: Reinforcement Learning for Search-Efficient Large Language Models

Add code
May 12, 2025
Viaarxiv icon

Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models

Add code
Apr 18, 2025
Viaarxiv icon

TroubleLLM: Align to Red Team Expert

Add code
Feb 28, 2024
Viaarxiv icon