Picture for Yiran Zhao

Yiran Zhao

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

Add code
Aug 10, 2026
Viaarxiv icon

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

Add code
Aug 09, 2026
Viaarxiv icon

Mental World Modeling

Add code
Jul 29, 2026
Viaarxiv icon

Learning Adaptive Semantic Gaussian Allocation for 3D Occupancy

Add code
Jul 24, 2026
Viaarxiv icon

Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models

Add code
Jul 02, 2026
Viaarxiv icon

Multilingual Fine-Tuning via Localized Gradient Conflict Resolution

Add code
Jun 04, 2026
Viaarxiv icon

Towards Accurate Single Panoramic 3D Detection: A Semantic Gaussian Centric Approach

Add code
May 14, 2026
Viaarxiv icon

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

Add code
May 11, 2026
Viaarxiv icon

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

Add code
Mar 09, 2026
Viaarxiv icon

In-Context Reinforcement Learning for Tool Use in Large Language Models

Add code
Mar 09, 2026
Viaarxiv icon