Picture for Yongqi Tong

Yongqi Tong

STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment

Add code
Aug 17, 2026
Viaarxiv icon

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

Add code
Aug 17, 2026
Viaarxiv icon

ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

Add code
Aug 13, 2026
Viaarxiv icon

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

Add code
Aug 12, 2026
Viaarxiv icon

Optimal Transport for LLM Reward Modeling from Noisy Preference

Add code
May 07, 2026
Viaarxiv icon

Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary

Add code
May 23, 2025
Viaarxiv icon

REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective

Add code
Apr 15, 2025
Figure 1 for REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
Figure 2 for REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
Figure 3 for REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
Figure 4 for REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
Viaarxiv icon

BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment

Add code
Nov 16, 2024
Figure 1 for BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
Figure 2 for BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
Figure 3 for BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
Figure 4 for BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
Viaarxiv icon

Optimizing Language Model's Reasoning Abilities with Weak Supervision

Add code
May 07, 2024
Figure 1 for Optimizing Language Model's Reasoning Abilities with Weak Supervision
Figure 2 for Optimizing Language Model's Reasoning Abilities with Weak Supervision
Figure 3 for Optimizing Language Model's Reasoning Abilities with Weak Supervision
Figure 4 for Optimizing Language Model's Reasoning Abilities with Weak Supervision
Viaarxiv icon

Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning

Add code
Mar 29, 2024
Figure 1 for Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
Figure 2 for Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
Figure 3 for Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
Figure 4 for Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
Viaarxiv icon