Picture for Edwin Chen

Edwin Chen

Chartography: A Benchmark for Professional Chart Understanding

Add code
Aug 11, 2026
Viaarxiv icon

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

Add code
Aug 03, 2026
Viaarxiv icon

Cross-Benchmark Generalization in Long-Horizon Agents

Add code
Jul 31, 2026
Viaarxiv icon

HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

Add code
Jul 28, 2026
Viaarxiv icon

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

Add code
Jul 14, 2026
Viaarxiv icon

ComplexConstraints and Beyond: Expert Rubrics for RLVR

Add code
Jun 08, 2026
Viaarxiv icon

Riemann-Bench: A Benchmark for Moonshot Mathematics

Add code
Apr 08, 2026
Viaarxiv icon

EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

Add code
Feb 19, 2026
Viaarxiv icon

Machine Learning as a Tool (MLAT): A Framework for Integrating Statistical ML Models as Callable Tools within LLM Agent Workflows

Add code
Feb 15, 2026
Viaarxiv icon

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

Add code
Jan 13, 2026
Viaarxiv icon