Picture for Sayash Kapoor

Sayash Kapoor

Can AI agents conduct open-ended AI research? Early evidence from two case studies

Add code
Jul 29, 2026
Viaarxiv icon

FLARE-AI: Flaw Reporting for AI

Add code
Jun 30, 2026
Viaarxiv icon

Life After Benchmark Saturation: A Case Study of CORE-Bench

Add code
Jun 23, 2026
Viaarxiv icon

Open-World Evaluations for Measuring Frontier AI Capabilities

Add code
May 19, 2026
Viaarxiv icon

Towards a Science of AI Agent Reliability

Add code
Feb 18, 2026
Viaarxiv icon

The 2025 Foundation Model Transparency Index

Add code
Dec 11, 2025
Figure 1 for The 2025 Foundation Model Transparency Index
Figure 2 for The 2025 Foundation Model Transparency Index
Figure 3 for The 2025 Foundation Model Transparency Index
Figure 4 for The 2025 Foundation Model Transparency Index
Viaarxiv icon

Establishing Best Practices for Building Rigorous Agentic Benchmarks

Add code
Jul 03, 2025
Figure 1 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 2 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 3 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 4 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Viaarxiv icon

The Leaderboard Illusion

Add code
Apr 29, 2025
Viaarxiv icon

Toward an Evaluation Science for Generative AI Systems

Add code
Mar 07, 2025
Viaarxiv icon

International AI Safety Report

Add code
Jan 29, 2025
Figure 1 for International AI Safety Report
Figure 2 for International AI Safety Report
Figure 3 for International AI Safety Report
Figure 4 for International AI Safety Report
Viaarxiv icon