Picture for Calvin Xiao

Calvin Xiao

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

Add code
Aug 20, 2026
Viaarxiv icon

Scalable Behaviour Cloning on Browser Using via Skill Distillation

Add code
Jun 30, 2026
Viaarxiv icon

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Add code
Apr 14, 2026
Viaarxiv icon