Picture for Tong Yu

Tong Yu

Sam

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

Add code
Jul 29, 2026
Viaarxiv icon

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

Add code
Jul 28, 2026
Viaarxiv icon

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

Add code
Jul 20, 2026
Viaarxiv icon

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

Add code
Jul 20, 2026
Viaarxiv icon

Promise and challenges of heart chamber segmentation from non-contrast CT scans using contrastive unpaired image translation: a feasibility study

Add code
Jun 22, 2026
Viaarxiv icon

F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking

Add code
May 13, 2026
Viaarxiv icon

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

Add code
May 11, 2026
Viaarxiv icon

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

Add code
May 11, 2026
Viaarxiv icon

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Add code
May 10, 2026
Viaarxiv icon

A Survey on LLM-based Conversational User Simulation

Add code
Apr 27, 2026
Viaarxiv icon