Picture for Zixing Chen

Zixing Chen

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

Add code
Aug 11, 2026
Viaarxiv icon

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

Add code
Jul 02, 2026
Viaarxiv icon

HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models

Add code
Apr 14, 2026
Viaarxiv icon