Policyを時系列モデル化し、そのTrainerを追加
## 概要
以前から言われていたPolicyの時系列モデル化を行い、そのTrainerを実装しました。
好奇心の理論背景に従い、`Reward`を直接最大化するように実装しています。
https://github.com/MLShukai/ami-theory/blob/main/dist/long_span_prediction_reward.pdf
## 変更内容
* TemporalPolicyValueCommonNetを追加
* TemporalPPOPolicyTrainerを追加
## 影響範囲
<!-- この関数を変更したのでこの機能にも影響がある、など -->
## Submit前の確認項目
<!-- PRをSubmitする前に確認する項目 -->
- [x] タイトルは一目でわかるようにし、説明文は PR を簡潔に説明するようにしましたか?
- [x] あなたの PR が、異なる変更を束ねたものではなく、ひとつのことだけを行うものであることを確認しましたか?
- [x] この PR で導入されたすべての変更点をリストアップしましたか?
- [x] PR を`make run`コマンドでローカルでテストしましたか?
## 補足
<!-- レビューをする際に見てほしい点、ローカル環境で試す際の注意点、など -->
合并状态:已合并 合并于 2025-03-11 关闭于 2025-03-11 0 条评论