テクノロジー
Xiaomi『UCAG-P』、カメラ座標系の動きで9種の身体を1方策に統一 LIBERO 98.3%・RoboTwin Hard 89.2%を単一チェックポイントで
出典: arXivhttps://arxiv.org/abs/2608.26058公開:
原文を読む
3行まとめ
1
操作を「カメラから観測できるアンカーの動き」として画像・カメラ座標系で表現し、幾何条件付きの行動変換器で機体固有の制御へ変換する。ロボット腕・ヒューマノイド・人の手を1方策で扱う
2
学習データはロボット・シミュレーション4,030時間+人の実演2,340時間、11データセット・9種の身体
3
ベンチマーク別の微調整なしの単一チェックポイントでLIBERO 98.3%、RoboTwin Easy/Hard 88.7%/89.2%、LIBERO-Plusゼロショット82.0%、RoboCasa GR-1 62.0%。コードは公開予定
要約
Xiaomi Embodied Intelligence Teamとマカオ大学は、異なる身体をまたぐVLA方策の事前学習フレームワーク「UCAG-P(Unified Camera-Centric Action Geometry Pre-training)」を技術報告として公開した。核となる考え方は、行動をロボット固有の関節指令ではなく「カメラから観測できるアンカーの動き」として画像座標・カメラ座標系で表現すること。これなら単腕・双腕・器用な手・人の手のいずれの実演も同じ空間で扱える。予測した動きは幾何条件付きの行動変換器で各機体の制御信号に戻す。
学習データはロボットとシミュレーションの4,030時間に人の実演2,340時間を加えた計6,300時間超で、11データセット・9種の身体をカバーする。ベンチマーク別の微調整をしない単一チェックポイントで、LIBERO 98.3%、RoboTwin Easy 88.7%・Hard 89.2%、LIBERO-Plusのゼロショット82.0%、RoboCasa GR-1 62.0%を報告している。実機はAgileX Piperでペン立てや引き出し開けを示すにとどまり、実機での数値は詳しくない。人の手の動きをそのまま学習に使える表現という点で、PerceptronのIsaac 0.5やZero-WAMと同じ「人の動画をどう身体に落とすか」という問いに、座標系の側から答えている。コードとモデルは公開予定とされる。
出典: arXivhttps://arxiv.org/abs/2608.26058公開:
原文