Picture for Hu Wei

Hu Wei

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

Add code
Aug 03, 2026
Viaarxiv icon

Living-Harness Is an Interactive-Agent Evolver

Add code
Jul 29, 2026
Viaarxiv icon

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

Add code
Jul 27, 2026
Viaarxiv icon

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

Add code
Jul 17, 2026
Viaarxiv icon

Discovering Millions of Interpretable Features with Sparse Autoencoders

Add code
Jun 25, 2026
Viaarxiv icon

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

Add code
Jun 25, 2026
Viaarxiv icon

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

Add code
Jun 11, 2026
Viaarxiv icon

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

Add code
Jun 05, 2026
Viaarxiv icon

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

Add code
Jun 02, 2026
Viaarxiv icon

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

Add code
May 29, 2026
Viaarxiv icon