Picture for Yifan Mai

Yifan Mai

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

Add code
Aug 05, 2026
Viaarxiv icon

Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries

Add code
Jun 27, 2026
Viaarxiv icon

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Add code
Jun 12, 2026
Viaarxiv icon

Characterizing Delusional Spirals through Human-LLM Chat Logs

Add code
Mar 17, 2026
Viaarxiv icon

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

Add code
Mar 16, 2026
Viaarxiv icon

OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets

Add code
Mar 03, 2026
Viaarxiv icon

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

Add code
Jan 22, 2026
Viaarxiv icon

The Singapore Consensus on Global AI Safety Research Priorities

Add code
Jun 25, 2025
Figure 1 for The Singapore Consensus on Global AI Safety Research Priorities
Figure 2 for The Singapore Consensus on Global AI Safety Research Priorities
Figure 3 for The Singapore Consensus on Global AI Safety Research Priorities
Viaarxiv icon

Judging LLMs on a Simplex

Add code
May 28, 2025
Viaarxiv icon

MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks

Add code
May 26, 2025
Figure 1 for MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
Figure 2 for MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
Figure 3 for MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
Figure 4 for MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
Viaarxiv icon