Picture for Ben Wang

Ben Wang

Tony

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

Add code
Aug 04, 2026
Viaarxiv icon

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

Add code
Aug 04, 2026
Viaarxiv icon

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

Add code
May 29, 2026
Viaarxiv icon

FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning

Add code
Apr 04, 2026
Viaarxiv icon

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

Add code
Mar 31, 2026
Viaarxiv icon

SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy

Add code
Feb 26, 2026
Viaarxiv icon

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

Add code
Feb 17, 2026
Viaarxiv icon

MMSF: Multitask and Multimodal Supervised Framework for WSI Classification and Survival Analysis

Add code
Jan 28, 2026
Viaarxiv icon

The Geometric Reasoner: Manifold-Informed Latent Foresight Search for Long-Context Reasoning

Add code
Jan 25, 2026
Viaarxiv icon

Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models

Add code
Oct 01, 2025
Figure 1 for Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models
Figure 2 for Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models
Figure 3 for Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models
Figure 4 for Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models
Viaarxiv icon