Picture for Beidi Luan

Beidi Luan

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

Add code
Jul 31, 2026
Viaarxiv icon

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

Add code
Jul 27, 2026
Viaarxiv icon

FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality

Add code
Jul 14, 2026
Viaarxiv icon

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

Add code
May 27, 2026
Viaarxiv icon