Picture for Xinyuan Song

Xinyuan Song

ISO: An RLVR-Native Optimization Stack

Add code
Jul 21, 2026
Viaarxiv icon

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

Add code
Jul 05, 2026
Viaarxiv icon

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

Add code
Jul 05, 2026
Viaarxiv icon

ManifoldFlow: SPD-Relaxed Stiefel Layers with Learnable Singular Spectrum

Add code
Jul 05, 2026
Viaarxiv icon

Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

Add code
Jul 05, 2026
Viaarxiv icon

Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

Add code
Jul 05, 2026
Viaarxiv icon

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

Add code
Jul 02, 2026
Viaarxiv icon

World-Model Collapse as a Phase Transition

Add code
Jun 30, 2026
Viaarxiv icon

Ask the World Before Acting: Budgeted Environment Probing for World-Model Calibration

Add code
Jun 30, 2026
Viaarxiv icon

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

Add code
Jun 30, 2026
Viaarxiv icon