Picture for He Zhu

He Zhu

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

Add code
Jul 20, 2026
Viaarxiv icon

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

Add code
Jun 10, 2026
Viaarxiv icon

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

Add code
Jun 08, 2026
Viaarxiv icon

PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

Add code
Jun 04, 2026
Viaarxiv icon

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

Add code
Jun 01, 2026
Viaarxiv icon

TVIR: Building Deep Research Agents Towards Text--Visual Interleaved Report Generation

Add code
Jun 01, 2026
Viaarxiv icon

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

Add code
Apr 16, 2026
Viaarxiv icon

RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection

Add code
Mar 13, 2026
Viaarxiv icon

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

Add code
Mar 11, 2026
Viaarxiv icon

Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization

Add code
Feb 26, 2026
Viaarxiv icon