Picture for Jianhong Tu

Jianhong Tu

additional authors not shown

WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning

Add code
Jul 10, 2026
Viaarxiv icon

Qwen-AgentWorld: Language World Models for General Agents

Add code
Jun 23, 2026
Viaarxiv icon

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

Add code
Jun 11, 2026
Viaarxiv icon

Agents' Last Exam

Add code
Jun 03, 2026
Viaarxiv icon

CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

Add code
Jun 03, 2026
Viaarxiv icon

Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows

Add code
May 14, 2026
Viaarxiv icon

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models

Add code
Apr 13, 2026
Viaarxiv icon

WebWorld: A Large-Scale World Model for Web Agent Training

Add code
Feb 16, 2026
Viaarxiv icon

DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints

Add code
Jan 26, 2026
Viaarxiv icon

One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning

Add code
Oct 30, 2025
Figure 1 for One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning
Figure 2 for One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning
Figure 3 for One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning
Figure 4 for One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning
Viaarxiv icon