Picture for Xintong Li

Xintong Li

Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees

Add code
Aug 03, 2026
Viaarxiv icon

UniPolymer: A Unified Framework for Property Prediction, Structure Recommendation, and Evaluation in Polyimide Design

Add code
Jul 31, 2026
Viaarxiv icon

Kimi K3: Open Frontier Intelligence

Add code
Jul 27, 2026
Viaarxiv icon

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

Add code
Jul 20, 2026
Viaarxiv icon

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

Add code
Jul 17, 2026
Viaarxiv icon

F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking

Add code
May 13, 2026
Viaarxiv icon

Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

Add code
May 12, 2026
Viaarxiv icon

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

Add code
May 11, 2026
Viaarxiv icon

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Add code
May 10, 2026
Viaarxiv icon

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

Add code
Feb 27, 2026
Viaarxiv icon