Picture for Yuxiao Dong

Yuxiao Dong

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

Add code
Jul 13, 2026
Viaarxiv icon

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

Add code
Jul 08, 2026
Viaarxiv icon

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

Add code
Jul 06, 2026
Viaarxiv icon

GLM-5: from Vibe Coding to Agentic Engineering

Add code
Feb 17, 2026
Viaarxiv icon

TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference

Add code
Sep 18, 2025
Figure 1 for TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
Figure 2 for TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
Figure 3 for TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
Figure 4 for TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
Viaarxiv icon

ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding

Add code
Aug 27, 2025
Viaarxiv icon

ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents

Add code
Aug 19, 2025
Viaarxiv icon

GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models

Add code
Aug 08, 2025
Viaarxiv icon

GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

Add code
Jul 02, 2025
Figure 1 for GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
Figure 2 for GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
Figure 3 for GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
Figure 4 for GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
Viaarxiv icon

TreeRL: LLM Reinforcement Learning with On-Policy Tree Search

Add code
Jun 13, 2025
Viaarxiv icon