Picture for Yunhao Feng

Yunhao Feng

SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse

Add code
Aug 07, 2026
Viaarxiv icon

When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems

Add code
Aug 07, 2026
Viaarxiv icon

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

Add code
Jul 02, 2026
Viaarxiv icon

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

Add code
Jun 22, 2026
Viaarxiv icon

Constitutional On-Policy Safe Distillation

Add code
Jun 02, 2026
Viaarxiv icon

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

Add code
May 31, 2026
Viaarxiv icon

Position: AI Safety Requires Effective Controllability

Add code
May 26, 2026
Viaarxiv icon

SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems

Add code
Apr 08, 2026
Viaarxiv icon

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

Add code
Apr 03, 2026
Viaarxiv icon

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

Add code
Jan 08, 2026
Viaarxiv icon