Picture for Jeonghye Kim

Jeonghye Kim

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

Add code
Jun 29, 2026
Viaarxiv icon

Be My Tutor: On-Policy Co-Distillation for Mutual LLM Improvement via Peer Feedback

Add code
Jun 12, 2026
Viaarxiv icon

Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR

Add code
May 11, 2026
Viaarxiv icon

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

Add code
Mar 25, 2026
Viaarxiv icon

Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty

Add code
Mar 16, 2026
Viaarxiv icon

Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization

Add code
Feb 26, 2026
Viaarxiv icon

Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

Add code
Feb 13, 2026
Viaarxiv icon

Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents

Add code
Dec 30, 2025
Viaarxiv icon

RAISE: Enhancing Scientific Reasoning in LLMs via Step-by-Step Retrieval

Add code
Jun 10, 2025
Viaarxiv icon

ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection

Add code
May 21, 2025
Viaarxiv icon