テクノロジー
TemporalFlow-VLA、実行履歴を幾何で教え込んで長期タスクへ LIBERO 97.6%・RoboTwin 85.5%
出典: arXivhttps://arxiv.org/abs/2608.26821公開:
原文を読む
3行まとめ
1
多段階の操作でVLAが直近の物理的変化を捉えられない問題に対し、学習時に「物理的に接地した時間的教師信号」を与える
2
ロボットの状態記録・幾何・校正済みカメラから時間的フローを構成し、実行に整合した2つの時間クエリで行動予測側に履歴を渡す
3
幾何由来の教師信号は配備時には取り除く。LIBEROで約97.6%、RoboTwinの各タスクで85.5%〜84.2%を報告し、行動選択が履歴の内容と順序の両方に依存することを示した
要約
多段階の操作課題では、直前に何をどこまで進めたかという実行履歴が次の行動を決める。しかしVLAは基本的に現在の観測と言語指示から行動を出す構成のため、直近に起きた物理的変化を取りこぼしやすい。TemporalFlow-VLAは、この履歴を明示的なメモリ機構ではなく学習時の教師信号として与えるという方向を採る。
具体的には、ロボットの状態記録・シーンの幾何・校正済みカメラの情報から時間的なフローのパターンを構成し、実行に整合した2つの時間クエリを通じて行動予測側へ構造化された履歴を供給する。要点は、この幾何由来の教師信号を配備時には取り除くことで、実機で動かす際に明示的な運動推定や幾何処理を必要としない点にある。報告値はLIBEROで約97.6%、RoboTwinの各タスクで85.5%〜84.2%。また行動選択が履歴の内容だけでなく順序にも依存することを示しており、単に過去フレームを積むだけでは足りないという主張になっている。前日のStreamPIが注意機構の側から時間的推論を足したのに対し、こちらは教師信号の作り方で同じ欠落を埋めている。
出典: arXivhttps://arxiv.org/abs/2608.26821公開:
原文
