Picture for Xiangxin Zhou

Xiangxin Zhou

SceneActBench: Can Agents Act on the 3D Scenes They See?

Add code
Jul 24, 2026
Viaarxiv icon

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

Add code
Jul 21, 2026
Viaarxiv icon

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

Add code
Jul 16, 2026
Viaarxiv icon

Predictive Divergence Masks for LLM RL

Add code
Jul 12, 2026
Viaarxiv icon

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

Add code
Jun 26, 2026
Viaarxiv icon

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

Add code
Jun 09, 2026
Viaarxiv icon

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Add code
Jun 09, 2026
Viaarxiv icon

Exploring the Design Space of Reward Backpropagation for Flow Matching

Add code
Jun 09, 2026
Viaarxiv icon

Rethinking the Divergence Regularization in LLM RL

Add code
Jun 08, 2026
Viaarxiv icon

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

Add code
May 28, 2026
Viaarxiv icon