Picture for Dayang Liang

Dayang Liang

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

Add code
Aug 20, 2026
Viaarxiv icon

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

Add code
Aug 18, 2026
Viaarxiv icon

Learning Task-relevant Sequence Representations via Intrinsic Dynamics Characteristics in Reinforcement Learning

Add code
May 30, 2024
Viaarxiv icon

Episodic Reinforcement Learning with Expanded State-reward Space

Add code
Jan 19, 2024
Viaarxiv icon

Sequential Action-Induced Invariant Representation for Reinforcement Learning

Add code
Sep 22, 2023
Viaarxiv icon