ハード制約を超えて:安全なオフライン強化学習のための予算条件付き到達可能性
ハード制約を超えて:安全なオフライン強化学習のための予算条件付き到達可能性 安全な強化学習における敵対的トラップ 従来の安全な強化学習は、安全性をハード制約として定式化します。数学的には、すべての軌跡を通じて不等式制約 g(s,a) ≤ 0 を満たす必要がある状態行動対として表現されます。この二値的な枠組みは、根本的な最適化の対立を生み出します。目的関数は、期待累積報酬を最大化しながら同時に制約違反確率をゼロに保つ必要があるのです。結果として生じるミニマッ...