Picture for Saiyong Yang

Saiyong Yang

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

Add code
Aug 13, 2026
Viaarxiv icon

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

Add code
Jun 09, 2026
Viaarxiv icon

ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation

Add code
May 27, 2026
Viaarxiv icon

RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data

Add code
May 26, 2026
Viaarxiv icon

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation

Add code
May 13, 2026
Viaarxiv icon

Debiased Model-based Representations for Sample-efficient Continuous Control

Add code
May 12, 2026
Viaarxiv icon

Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

Add code
May 07, 2026
Viaarxiv icon

Tool Learning Needs Nothing More Than a Free 8B Language Model

Add code
Apr 20, 2026
Viaarxiv icon

Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models

Add code
Feb 12, 2026
Viaarxiv icon

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

Add code
Feb 12, 2026
Viaarxiv icon