Picture for Zixin Zhong

Zixin Zhong

MESHA: Mechanism-Enforced Sequential Halving for Strategic Linear Bandits

Add code
Jul 16, 2026
Viaarxiv icon

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

Add code
Jun 13, 2026
Viaarxiv icon

On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits

Add code
May 25, 2026
Viaarxiv icon

Rethinking Token-Level Credit Assignment in RLVR: A Polarity-Entropy Analysis

Add code
Apr 13, 2026
Viaarxiv icon

Label Smoothing Improves Gradient Ascent in LLM Unlearning

Add code
Oct 25, 2025
Viaarxiv icon

Almost Minimax Optimal Best Arm Identification in Piecewise Stationary Linear Bandits

Add code
Oct 10, 2024
Viaarxiv icon

Stochastic Gradient Succeeds for Bandits

Add code
Feb 27, 2024
Figure 1 for Stochastic Gradient Succeeds for Bandits
Figure 2 for Stochastic Gradient Succeeds for Bandits
Figure 3 for Stochastic Gradient Succeeds for Bandits
Figure 4 for Stochastic Gradient Succeeds for Bandits
Viaarxiv icon

Probably Anytime-Safe Stochastic Combinatorial Semi-Bandits

Add code
Jan 31, 2023
Viaarxiv icon

Fast Beam Alignment via Pure Exploration in Multi-armed Bandits

Add code
Oct 23, 2022
Figure 1 for Fast Beam Alignment via Pure Exploration in Multi-armed Bandits
Figure 2 for Fast Beam Alignment via Pure Exploration in Multi-armed Bandits
Figure 3 for Fast Beam Alignment via Pure Exploration in Multi-armed Bandits
Figure 4 for Fast Beam Alignment via Pure Exploration in Multi-armed Bandits
Viaarxiv icon

Optimal Clustering with Bandit Feedback

Add code
Feb 09, 2022
Figure 1 for Optimal Clustering with Bandit Feedback
Figure 2 for Optimal Clustering with Bandit Feedback
Figure 3 for Optimal Clustering with Bandit Feedback
Figure 4 for Optimal Clustering with Bandit Feedback
Viaarxiv icon