ITADN

Policyを時系列モデル化し、そのTrainerを追加

#286Pull RequestGeson-anko 创建于 2025-03-11已合并
G
Geson-ankocommented
## 概要 以前から言われていたPolicyの時系列モデル化を行い、そのTrainerを実装しました。 好奇心の理論背景に従い、`Reward`を直接最大化するように実装しています。 https://github.com/MLShukai/ami-theory/blob/main/dist/long_span_prediction_reward.pdf ## 変更内容 * TemporalPolicyValueCommonNetを追加 * TemporalPPOPolicyTrainerを追加 ## 影響範囲 <!-- この関数を変更したのでこの機能にも影響がある、など --> ## Submit前の確認項目 <!-- PRをSubmitする前に確認する項目 --> - [x] タイトルは一目でわかるようにし、説明文は PR を簡潔に説明するようにしましたか? - [x] あなたの PR が、異なる変更を束ねたものではなく、ひとつのことだけを行うものであることを確認しましたか? - [x] この PR で導入されたすべての変更点をリストアップしましたか? - [x] PR を`make run`コマンドでローカルでテストしましたか? ## 補足 <!-- レビューをする際に見てほしい点、ローカル環境で試す際の注意点、など -->
合并状态:已合并 合并于 2025-03-11 关闭于 2025-03-11 0 条评论