Picture for Guanzhong He

Guanzhong He

Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

Add code
Jun 29, 2026
Viaarxiv icon

WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection

Add code
Oct 21, 2025
Viaarxiv icon

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

Add code
Jun 07, 2025
Viaarxiv icon