Picture for Lu Pan

Lu Pan

Retrieval Grounding Latent Reasoning for Dense Retrieval

Add code
Aug 14, 2026
Viaarxiv icon

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

Add code
Aug 08, 2026
Viaarxiv icon

How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

Add code
Aug 07, 2026
Viaarxiv icon

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

Add code
Aug 05, 2026
Viaarxiv icon

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

Add code
Aug 03, 2026
Viaarxiv icon

ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments

Add code
Jul 02, 2026
Viaarxiv icon

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents

Add code
Jun 03, 2026
Viaarxiv icon

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

Add code
Jun 01, 2026
Viaarxiv icon

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

Add code
May 30, 2026
Viaarxiv icon

From $\boldsymbol{\logπ}$ to $\boldsymbolπ$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

Add code
Mar 15, 2026
Viaarxiv icon