冻结策略迭代:确定性动态下线性可实现性条件下的计算高效强化学习 Frozen Policy Iteration Computationally Efficient RL under Linear Q^π Realizability for Deterministic Dynamics.pdf

冻结策略迭代:确定性动态下线性可实现性条件下的计算高效强化学习 Frozen Policy Iteration Computationally Efficient RL under Linear Q^π Realizability for Deterministic Dynamics.pdf

PublishedasaconferencepaperatICLR2026

FROZENPOLICYITERATION:COMPUTATIONALLYEF-

FICIENTRLUNDERLINEARQπREALIZABILITYFOR

DETERMINISTICDYNAMICS

文档评论(0)

1亿VIP精品文档

相关文档