テクノロジー
Princeton「CLAP」 身体をまたぐ映像世界モデルはゼロショットの物理シミュレータになる 人の動画から潜在行動で物理事前分布を学ぶ
出典: arXivhttps://arxiv.org/abs/2608.27406公開:
原文を読む
3行まとめ
1
「物理法則は行為者に依らない」を前提に、行動条件付き映像生成を複数ロボットと人間で共通化。ラベル無し映像から潜在行動で物理事前分布を学び、次にEE行動空間へ接地するカリキュラム
2
Open X-Embodiment(Bridge・DROID・Fractal等)とEgoDexで学習。潜在VAE+U-Netの映像拡散、潜在行動は24ブロック・幅1024の時空間Transformer
3
DROIDで単一身体の最先端に迫るか上回り、事後学習後はほぼ全知覚指標で上回る。未学習のYAM双腕(14次元)とG1(26次元)にも少数ショット適応。H200で1.49秒/推論、コード・モデル公開
要約
Princeton大学のKechen LiuとOla Shorinwaは、身体(embodiment)をまたぐ行動条件付き映像世界モデル「CLAP」を公開した。前提は「時空間の動力学を支配する物理法則は行為者に依らない」で、ロボットごとに異なりヒト動画には存在しない行動表現を、エンドエフェクタ姿勢・言語指示・潜在行動の3つで調停する。学習はカリキュラム型で、まずラベル無し映像から潜在行動を介して物理事前分布を学び、次にエンドエフェクタの行動空間へ接地して実機で使える形にする。
データはOpen X-Embodiment(Bridge・DROID・Fractal・BC-Z・FMB・Furniture Bench・Taco Play)とEgoDex。映像は連続VAEでトークン化しU-Netで時空間をモデル化、潜在行動モデルは24ブロック・幅1024・16ヘッドの分解型時空間Transformerで、H100/H200×8で10万ステップ(2〜3日)学習する。DROIDのような難しい環境で単一身体の最先端モデルに迫るか上回り、事後学習後はほぼ全ての知覚指標で上回る。学習に含まれないYAM双腕(14次元行動)とUnitree G1ヒューマノイド(26次元)にも少数ショットで適応した。推論はA100で3.24秒、H200で1.49秒。コードとモデルはGitHubで公開されている。Riemann-1.0と同日に出ており、人の動画を世界モデル側の事前学習に使う流れが続く。
出典: arXivhttps://arxiv.org/abs/2608.27406公開:
原文