Picture for Songjun Tu

Songjun Tu

MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents

Add code
Jul 27, 2026
Viaarxiv icon

UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation

Add code
Jun 28, 2026
Viaarxiv icon

Are Full Rollouts Necessary for On-Policy Distillation?

Add code
Jun 01, 2026
Viaarxiv icon

One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs

Add code
May 21, 2026
Viaarxiv icon

$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data

Add code
Apr 15, 2026
Viaarxiv icon

Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

Add code
Apr 07, 2026
Viaarxiv icon

Dynamic Dual-Granularity Skill Bank for Agentic RL

Add code
Mar 30, 2026
Viaarxiv icon

SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning

Add code
Jun 24, 2025
Viaarxiv icon

AlphaDecay:Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs

Add code
Jun 17, 2025
Viaarxiv icon

Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL

Add code
May 16, 2025
Figure 1 for Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
Figure 2 for Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
Figure 3 for Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
Figure 4 for Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
Viaarxiv icon