Picture for Lang Feng

Lang Feng

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

Add code
Aug 20, 2026
Viaarxiv icon

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Add code
Jul 16, 2026
Viaarxiv icon

REAR: Test-time Preference Realignment through Reward Decomposition

Add code
Jun 29, 2026
Viaarxiv icon

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

Add code
Jun 25, 2026
Viaarxiv icon

Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

Add code
May 26, 2026
Viaarxiv icon

PrismFlow: Residual Dynamics for Flow Matching in Time-Series Generation

Add code
May 22, 2026
Viaarxiv icon

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

Add code
Feb 26, 2026
Viaarxiv icon

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

Add code
Feb 11, 2026
Viaarxiv icon

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Add code
Feb 09, 2026
Viaarxiv icon

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

Add code
Feb 09, 2026
Viaarxiv icon