Picture for Yiming Du

Yiming Du

Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback

Add code
Aug 18, 2026
Viaarxiv icon

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

Add code
Aug 18, 2026
Viaarxiv icon

Mitigating Context Interference for Reliable and Efficient Search Agents

Add code
Aug 11, 2026
Viaarxiv icon

What Makes Interaction Trajectories Effective for Training Terminal Agents?

Add code
Jun 02, 2026
Viaarxiv icon

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

Add code
May 26, 2026
Viaarxiv icon

MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

Add code
May 14, 2026
Viaarxiv icon

Deep Incomplete Multi-View Clustering via Hierarchical Imputation and Alignment

Add code
Jan 14, 2026
Viaarxiv icon

SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue Resolving

Add code
Jan 07, 2026
Viaarxiv icon

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Add code
Dec 23, 2025
Viaarxiv icon

ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning

Add code
Aug 27, 2025
Figure 1 for ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
Figure 2 for ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
Figure 3 for ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
Figure 4 for ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
Viaarxiv icon