テクノロジー
Riemann Dynamics、方策と世界シミュレータを1つの因果自己回帰モデルに統合した「Riemann-1.0」 一人称動画20万時間超で事前学習
出典: arXivhttps://arxiv.org/abs/2608.27033公開:
原文を読む
3行まとめ
1
完全因果の自己回帰Transformerにflow matchingを組み合わせ、実行可能な方策と行動条件付きの映像シミュレータを同じ系列モデルで兼ねる
2
データは一人称動画20万時間超、手持ちグリッパ1.2万時間超、異種ロボット軌道2万時間超。映像動力学→軌道接地→ロボット別強化の3段階で学習
3
LIBERO 99.0%、RoboTwin 2.0 94.3%、RoboCasa-365 62.6%(+8.4pt)。実機の長時間タスクは成功率85.0%で、π0.5・LingBot-VLA等の最良ベースラインを15pt上回る
要約
Riemann Dynamicsは、ロボット操作向けのWorld Action Model「Riemann-1.0」を論文とサイトで公開した。多視点の視覚観測、ロボット状態、身体(embodiment)ごとに異なる行動を1本の因果系列として扱う完全因果の自己回帰Transformerで、flow matchingを目的関数に組み合わせる。同じモデルが実行可能な方策として動くと同時に、行動を条件とした映像の世界シミュレータとしても振る舞う点が設計の中心で、NVIDIAが提唱した「VLAからWAMへ」の流れに沿った実装の一つになる。
学習データは一人称の人間動画20万時間超、手持ちグリッパのデモ1.2万時間超、異種ロボット軌道2万時間超(生データで計23.2万時間超)。ラベル無し映像で視覚動力学を学ぶ段階、混合の行動監督で軌道に接地する段階、ロボット別に方策を強化する段階の3段で段階的に事前学習する。シミュレーションではLIBERO 99.0%、RoboTwin 2.0 94.3%、RoboCasa-365 62.6%(従来比+8.4ポイント)。実機ではデスク整理80%、衣類折り85%、キューブ積み85%、キッチン90%で、長時間タスク全体の成功率85.0%・進捗成功率94.4%はDreamZero・π0.5・LingBot-VLA等の最良ベースラインを15ポイント上回る。モデル規模とコード・重みの公開は明記されていない。
出典: arXivhttps://arxiv.org/abs/2608.27033公開:
原文