Picture for Zhipeng Qiao

Zhipeng Qiao

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

Add code
Jul 21, 2026
Viaarxiv icon