Picture for Bing Zhao

Bing Zhao

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

Add code
Aug 03, 2026
Viaarxiv icon

Living-Harness Is an Interactive-Agent Evolver

Add code
Jul 29, 2026
Viaarxiv icon

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

Add code
Jul 27, 2026
Viaarxiv icon

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

Add code
Jul 17, 2026
Viaarxiv icon

Discovering Millions of Interpretable Features with Sparse Autoencoders

Add code
Jun 25, 2026
Viaarxiv icon

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

Add code
Jun 11, 2026
Viaarxiv icon

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

Add code
Jun 05, 2026
Viaarxiv icon

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

Add code
May 29, 2026
Viaarxiv icon

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

Add code
May 28, 2026
Viaarxiv icon

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Add code
May 27, 2026
Viaarxiv icon