Policy mirror descent (PMD) enjoys fast convergence in regularized Markov decision processes (MDPs), but existing guarantees often rely on exact or increasin…
机构:复旦
来源:arXiv 2609.39837 | AI4Papers 论文推荐平台