Picture for Hongtao Tian

Hongtao Tian

Co-Evolving LLM Evaluators and Policies via DynamicRubric

Add code
Jul 23, 2026
Viaarxiv icon

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

Add code
Jun 28, 2026
Viaarxiv icon

Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization

Add code
Sep 26, 2025
Viaarxiv icon

G-Core: A Simple, Scalable and Balanced RLHF Trainer

Add code
Jul 30, 2025
Viaarxiv icon

Discriminative Policy Optimization for Token-Level Reward Models

Add code
May 29, 2025
Viaarxiv icon

Wizard of Search Engine: Access to Information Through Conversations with Search Engines

Add code
May 18, 2021
Figure 1 for Wizard of Search Engine: Access to Information Through Conversations with Search Engines
Figure 2 for Wizard of Search Engine: Access to Information Through Conversations with Search Engines
Figure 3 for Wizard of Search Engine: Access to Information Through Conversations with Search Engines
Figure 4 for Wizard of Search Engine: Access to Information Through Conversations with Search Engines
Viaarxiv icon