Picture for Xiaomeng Hu

Xiaomeng Hu

Renmin University of China

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

Add code
Aug 04, 2026
Viaarxiv icon

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

Add code
Jul 26, 2026
Viaarxiv icon

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

Add code
Jul 21, 2026
Viaarxiv icon

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

Add code
Jul 02, 2026
Viaarxiv icon

Qwen-AgentWorld: Language World Models for General Agents

Add code
Jun 23, 2026
Viaarxiv icon

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

Add code
Jun 07, 2026
Viaarxiv icon

SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization

Add code
Jun 04, 2026
Viaarxiv icon

FLaG: Fine-Grained Latent Grouping for Hallucination Detection

Add code
May 29, 2026
Viaarxiv icon

EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

Add code
May 28, 2026
Viaarxiv icon

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models

Add code
Apr 13, 2026
Viaarxiv icon