Picture for Cozmin Ududec

Cozmin Ududec

Can AI agents conduct open-ended AI research? Early evidence from two case studies

Add code
Jul 29, 2026
Viaarxiv icon

How Inference Compute Shapes Frontier LLM Evaluation

Add code
Jun 16, 2026
Viaarxiv icon

Open-World Evaluations for Measuring Frontier AI Capabilities

Add code
May 19, 2026
Viaarxiv icon

Ask don't tell: Reducing sycophancy in large language models

Add code
Feb 27, 2026
Viaarxiv icon

Establishing Best Practices for Building Rigorous Agentic Benchmarks

Add code
Jul 03, 2025
Figure 1 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 2 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 3 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Figure 4 for Establishing Best Practices for Building Rigorous Agentic Benchmarks
Viaarxiv icon

HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics

Add code
May 08, 2025
Viaarxiv icon