Picture for Qicheng Li

Qicheng Li

Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

Add code
Aug 03, 2026
Viaarxiv icon

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

Add code
Aug 03, 2026
Viaarxiv icon

TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization

Add code
Jun 04, 2026
Viaarxiv icon

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

Add code
Apr 09, 2026
Viaarxiv icon

OmniOVCD: Streamlining Open-Vocabulary Change Detection with SAM 3

Add code
Jan 20, 2026
Viaarxiv icon

Cross-Modal Knowledge Distillation for Speech Large Language Models

Add code
Sep 18, 2025
Viaarxiv icon

Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning

Add code
Sep 18, 2025
Viaarxiv icon

SDPO: Segment-Level Direct Preference Optimization for Social Agents

Add code
Jan 03, 2025
Figure 1 for SDPO: Segment-Level Direct Preference Optimization for Social Agents
Figure 2 for SDPO: Segment-Level Direct Preference Optimization for Social Agents
Figure 3 for SDPO: Segment-Level Direct Preference Optimization for Social Agents
Figure 4 for SDPO: Segment-Level Direct Preference Optimization for Social Agents
Viaarxiv icon

Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs

Add code
Jul 12, 2024
Figure 1 for Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
Figure 2 for Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
Figure 3 for Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
Figure 4 for Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
Viaarxiv icon

Better Zero-Shot Reasoning with Role-Play Prompting

Add code
Aug 15, 2023
Figure 1 for Better Zero-Shot Reasoning with Role-Play Prompting
Figure 2 for Better Zero-Shot Reasoning with Role-Play Prompting
Figure 3 for Better Zero-Shot Reasoning with Role-Play Prompting
Figure 4 for Better Zero-Shot Reasoning with Role-Play Prompting
Viaarxiv icon