Picture for Xinyu Tang

Xinyu Tang

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

Add code
Aug 07, 2026
Viaarxiv icon

ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding

Add code
Jul 30, 2026
Viaarxiv icon

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Add code
Jul 14, 2026
Viaarxiv icon

GraphPO: Graph-based Policy Optimization for Reasoning Models

Add code
Jun 17, 2026
Viaarxiv icon

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

Add code
Jun 08, 2026
Viaarxiv icon

Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards

Add code
Dec 25, 2025
Viaarxiv icon

Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model

Add code
Oct 21, 2025
Figure 1 for Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
Figure 2 for Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
Figure 3 for Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
Figure 4 for Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
Viaarxiv icon

Enhancing Cross-task Transfer of Large Language Models via Activation Steering

Add code
Jul 17, 2025
Figure 1 for Enhancing Cross-task Transfer of Large Language Models via Activation Steering
Figure 2 for Enhancing Cross-task Transfer of Large Language Models via Activation Steering
Figure 3 for Enhancing Cross-task Transfer of Large Language Models via Activation Steering
Figure 4 for Enhancing Cross-task Transfer of Large Language Models via Activation Steering
Viaarxiv icon

Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning

Add code
May 22, 2025
Viaarxiv icon

Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering

Add code
Mar 14, 2025
Figure 1 for Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
Figure 2 for Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
Figure 3 for Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
Figure 4 for Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
Viaarxiv icon