Picture for Du Ouyang

Du Ouyang

Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

Add code
Jul 31, 2026
Viaarxiv icon

A Zeroth-Order Deep Learning Method for Fully Nonlinear Parabolic Partial Differential Equations with Unknown Coefficients

Add code
Jun 23, 2026
Viaarxiv icon

Accuracy of Discretely Sampled Stochastic Policies in Continuous-time Reinforcement Learning

Add code
Mar 13, 2025
Viaarxiv icon