Picture for Wenhan Yu

Wenhan Yu

Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

Add code
Jul 31, 2026
Viaarxiv icon

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

Add code
Jul 30, 2026
Viaarxiv icon

ESPO: Early-Stopping Proximal Policy Optimization

Add code
May 28, 2026
Viaarxiv icon

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Add code
May 27, 2026
Viaarxiv icon

MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection

Add code
May 22, 2026
Viaarxiv icon

TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment

Add code
Jan 26, 2026
Viaarxiv icon

EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation

Add code
Jan 08, 2026
Viaarxiv icon

MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use

Add code
Dec 31, 2025
Viaarxiv icon

Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models

Add code
Nov 19, 2025
Figure 1 for Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
Figure 2 for Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
Figure 3 for Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
Figure 4 for Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
Viaarxiv icon

BBox DocVQA: A Large Scale Bounding Box Grounded Dataset for Enhancing Reasoning in Document Visual Question Answer

Add code
Nov 19, 2025
Viaarxiv icon