テクノロジー

論文『Zero-WAM』、人の動画を文脈として与え未見タスクを実行するWorld Action Model RoboTwin 2.0の未見7タスクで47.0%

3行まとめ
1
言語指示と人の動画デモの両方を文脈として受け取り、パラメータ更新なしで未見の操作タスクを実行するIn-Context型のWorld Action Model
2
ロボット軌道を人の動画と意味的に揃えた74.2K組・8.6KタスクのHumanGenデータセットを生成。視覚プロンプトへの依存を強める「文脈内未来チャンク予測」を目的関数に加える
3
RoboTwin 2.0の未見7タスクで平均47.0%、LingBot-VAベースラインを29.5ポイント上回る。実機では複数物体の連続配置とテーブル脚の挿入組み立てに汎化。コードとデータを公開
要約

Robbyant(Ant Groupのロボティクス研究部門)とHKUST(広州)・HKUSTの研究者は、人の動画を文脈として与えるだけで未見のタスクを実行するWorld Action Model「Zero-WAM」を発表した。言語指示と人の動画デモの両方を入力に受け取る統一タスクインタフェースを持ち、推論時にパラメータを更新しない。学習のため、既存のロボット軌道を人の動画と意味的に揃えた74.2K組の人-ロボットICLペアを8.6Kタスクにわたって生成するパイプライン(HumanGen)を作り、視覚プロンプトへの依存を強める「文脈内未来チャンク予測」を目的関数に加えている。

評価はRoboTwin 2.0の学習に含まれない7タスクで、平均成功率47.0%(46.95%)。LingBot-VAベースラインを29.5ポイント上回った。実機では複数の物体を指定位置へ順に置く長期タスクと、テーブル脚の挿入組み立てのような精密作業に汎化したとする。NVIDIAが「VLAの次」としてWorld Action Modelを打ち出し、今週GaussianWAMやLAWAが改良を重ねてきた流れに、「人の動画からの文脈内学習」という別の入口を加えた形。コードとデータはGitHubで公開している。

出典: arXivhttps://arxiv.org/abs/2608.26103公開:
原文