Picture for Xunyi Jiang

Xunyi Jiang

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

Add code
Jul 20, 2026
Viaarxiv icon

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

Add code
Jul 20, 2026
Viaarxiv icon

OpenThoughts-Agent: Data Recipes for Agentic Models

Add code
Jun 23, 2026
Viaarxiv icon

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Add code
May 10, 2026
Viaarxiv icon

Composer Vector: Style-steering Symbolic Music Generation in a Latent Space

Add code
Apr 03, 2026
Viaarxiv icon

MuseCPBench: an Empirical Study of Music Editing Methods through Music Context Preservation

Add code
Dec 16, 2025
Viaarxiv icon

When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation

Add code
Oct 08, 2025
Viaarxiv icon