PPO
による走行ポリシーの獲得
PPO (
近接方策最適化
)
•
強化学習のアルゴリズムとしてよく用いられる手法
•
ロボットに以下を定義し、報酬の増える方向にポリシーを更新
•
環境:大量のロボットを並列で物理シミュレートし、
状態:ロボットの今の姿勢と動き+進みたい方向の指令
•
出された目標角度をトルクに直して動かし、
行動:
ポリシーが出力する
各関節の目標角度
報酬を返す
•
高速な走行を実現するため、カリキュラム、報酬設計を調整する
Copyright © GMO Internet Group, Inc. All Rights Reserved.
20
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
カリキュラム学習
学習時、最初から高い目標速度を与えると極端に高い確率で
転倒が発生し、探索が進まなくなる
目標速度を低いところから段階的に引き上げる(カリキュラム学習)
具体的には学習時に、転倒率、最高速度が一定の基準を超えたら
目標速度をわずかに増やす
Copyright © GMO Internet Group, Inc. All Rights Reserved.
21
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
報酬設計
安定して歩行するための報酬設計は、
高速走行のためには必ずしも良いとは限らない
上下動の抑制
-
**> **
例
•
足を上げる高さの目標値
-
**> **
上下に動きやすい高速走行の探索が進みづらくなる
•
低めに設定する方がバランスを崩しにくいが、
足を高く上げた自然な走りの方向に学習が進みづらくなる
Copyright © GMO Internet Group, Inc. All Rights Reserved.
22
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
AMP
による走行ポリシーの獲得
Peng
**et al. **
(
2021
)
AMP: Adversarial Motion Priors
•
データセットとエージェントの行動が
•
PPO
による歩行動作の学習に、
どのくらい近いかを判別する判別器を置き、敵対的学習を行う
•
判別器から出力するモーション類似度報酬
(
スタイル報酬
)
を加えた形
スタイル報酬の係数
タスク報酬の係数
𝒔𝒕𝒚𝒍𝒆
𝒓𝒕= 𝒘𝒕𝒂𝒔𝒌𝒓𝒕
𝒕𝒂𝒔𝒌+ 𝒘𝒔𝒕𝒚𝒍𝒆𝒓𝒕
時刻
t
でのスタイル報酬
時刻
t
でのタスク報酬
時刻
t
でのトータルの報酬
モーションの模倣のための細かく複雑な報酬設計を避けられる
•
Copyright © GMO Internet Group, Inc. All Rights Reserved.
23
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
AMP
を素朴に適用し実機にデプロイ
Copyright © GMO Internet Group, Inc. All Rights Reserved.
24
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
AMP
の課題
•
モーションデータに含まれない動きの対応が難しい
•
具体的には姿勢を崩した状態からの復帰、急旋回
•
モーション、リターゲティング品質に繊細
•
先ほどの動画では足の内側が接触してバランスを大きく崩した
リターゲティングの際に、内股なモーションデータになっていた
•
Copyright © GMO Internet Group, Inc. All Rights Reserved.
25
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
ここまでのまとめ
カリキュラム
必要なことはこの3つ
•
とにかく
必須
•
リターゲティング
品質の向上
報酬設計
•
Copyright © GMO Internet Group, Inc. All Rights Reserved.
26
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
目次
1.
背景
: GMO
インターネットグループ陸上部
–
GMO
ロボッツ
2.
データ収集
**: **
モーションキャプチャとリターゲティング
3.
走行ポリシーの学習
4.
これまでの成果と明らかになった課題
5.
まとめと展望
Copyright © GMO Internet Group, Inc. All Rights Reserved.
27
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
これまでの成果
(PPO)
直線を
5m/s
以上で
•
左右のブレも少ない
安定して走行
•
Copyright © GMO Internet Group, Inc. All Rights Reserved.
28
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。
これまでの成果
(AMP)
•
以下の内容で改善
•
PPO
同様の報酬設計
リターゲティング処理を細かく修正
•
•
左右のブレや安定性には課題が残る
低速、高速の指示に合わせて自然な歩様で推移
•
Copyright © GMO Internet Group, Inc. All Rights Reserved.
29
スライドに記載されたテキスト全文:自動抽出のため、画像内のテキストなどが一部表示されない場合がございます。