Picture for Weiqi Zhai

Weiqi Zhai

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

Add code
Aug 07, 2026
Viaarxiv icon

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

Add code
Aug 03, 2026
Viaarxiv icon

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

Add code
Jul 17, 2026
Viaarxiv icon

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

Add code
Jul 13, 2026
Viaarxiv icon

ClinConsensus: A Consensus-Based Benchmark for Evaluating Chinese Medical LLMs across Difficulty Levels

Add code
Mar 03, 2026
Viaarxiv icon

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

Add code
Feb 17, 2026
Viaarxiv icon

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

Add code
Jan 31, 2026
Viaarxiv icon

VANER: Leveraging Large Language Model for Versatile and Adaptive Biomedical Named Entity Recognition

Add code
Apr 27, 2024
Viaarxiv icon

DMNER: Biomedical Entity Recognition by Detection and Matching

Add code
Jul 05, 2023
Figure 1 for DMNER: Biomedical Entity Recognition by Detection and Matching
Figure 2 for DMNER: Biomedical Entity Recognition by Detection and Matching
Figure 3 for DMNER: Biomedical Entity Recognition by Detection and Matching
Figure 4 for DMNER: Biomedical Entity Recognition by Detection and Matching
Viaarxiv icon