テクノロジー

8/26水 · 昨日 · 8件
Levineら『ARLI』、推論遅延のある大規模方策をRLで微調整する枠組みを提案
#vla08/26

Levineら『ARLI』、推論遅延のある大規模方策をRLで微調整する枠組みを提案

VLAの推論待ちがマルコフ性を壊しRLが機能しない問題に、確約済み行動と推論中観測で状態を拡張して対処。遅延なしのRLと同等以上。

arxiv.org
GigaAI、3.7万時間の身体データで学習した3システム構成の基盤モデルGigaBrain-0.7を公開
#vla08/26

GigaAI、3.7万時間の身体データで学習した3システム構成の基盤モデルGigaBrain-0.7を公開

理解・予測・行動を3つのシステムで統合。Hugging Face Papersで64票と、ロボ系論文として目立つ支持を集めた。

arxiv.org
論文『WorldEcho / WorldSync』、ロボット世界モデルが「行動に従っていない」ことを診断し補正

論文『WorldEcho / WorldSync』、ロボット世界モデルが「行動に従っていない」ことを診断し補正

既存の行動条件付き世界モデルは専門家軌道は再現できるが、非専門家の行動では指令を無視するか破綻することを実測で示した。

arxiv.org
論文『GaussianWAM』、3Dガウス場を教師にWorld Action Modelへ幾何と意味を蒸留 LIBERO-Plusで52%→71%

論文『GaussianWAM』、3Dガウス場を教師にWorld Action Modelへ幾何と意味を蒸留 LIBERO-Plusで52%→71%

学習時だけ多視点から深度・カメラ・意味特徴をガウス場に束ね、WAMの表現に蒸留。推論時の構成は変えない。

arxiv.org
論文『Gripper-aware VLA』、5種のグリッパで10.3万デモのMiGAデータセットとグリッパ条件付き方策GVLAを提案
#vla08/26

論文『Gripper-aware VLA』、5種のグリッパで10.3万デモのMiGAデータセットとグリッパ条件付き方策GVLAを提案

既存VLAは「グリッパが違っても同じ戦略」を暗黙に仮定している。ハンドの種類ごとに操作戦略が変わることをデータで示し、ルーティングで対処。

arxiv.org
論文『LAWA』、World Action Modelの未来予測を潜在行動で代替し推論遅延を42.9%削減

論文『LAWA』、World Action Modelの未来予測を潜在行動で代替し推論遅延を42.9%削減

動画フレームを生成せず、圧縮した潜在行動を「未来の意図」として扱う。RoboCasa few-shotで65.6%とFast-WAM比+9.6pt。

arxiv.org
『ROS2SmolVLA』、SmolVLAをUR10eで動かすROS 2実装を公開 オンプレ運用向け小型VLAの検証
#vla08/26

『ROS2SmolVLA』、SmolVLAをUR10eで動かすROS 2実装を公開 オンプレ運用向け小型VLAの検証

Hugging FaceのSmolVLAをUniversal Robotsの軽量ロボットに接続するオープンソースのROS 2インタフェース。ピック&プレースで検証。

arxiv.org
LimX DynamicsのTRON 2がWuji Hand 2を装着 生薬の取り出し・計量・粉砕・梱包を両手で連続実行

LimX DynamicsのTRON 2がWuji Hand 2を装着 生薬の取り出し・計量・粉砕・梱包を両手で連続実行

全方向移動ベース+両手の異なる役割分担で、引き出し・竿秤・乳鉢・紙袋という薬局の一連の作業をデモ。稼働数値はなし。

robotstart.info
8/25火 · 6件
NVIDIA、「VLAを超えて」World Action Modelへの転換を提唱 Cosmos 3ベースの新方策を公開

NVIDIA、「VLAを超えて」World Action Modelへの転換を提唱 Cosmos 3ベースの新方策を公開

NVIDIAが動画世界モデル由来のWorld Action ModelをVLAの後継として提唱。RoboLabで28.1%→36.8%に改善。

developer.nvidia.com
Google DeepMind、全身制御のGemini Robotics 2とER 2・On-Device 2の3モデルを発表
HUBdeepmind.google
#vla08/25

Google DeepMind、全身制御のGemini Robotics 2とER 2・On-Device 2の3モデルを発表

DeepMindが全身ヒューマノイド制御VLA・高次推論・オンデバイスの3モデルを同時公開、複数ロボットで実証。

deepmind.google
Generalist AI、3〜12秒のデモ1回で新タスクを覚えるGEN-1.5を公開
#vla08/25

Generalist AI、3〜12秒のデモ1回で新タスクを覚えるGEN-1.5を公開

デモ1回・数秒の提示だけで新タスクを学習するGEN-1.5。one-shotで平均成功率59%。

generalistai.com
NVIDIA、Jetson Thor向け4BパラメータのCosmos 3 Edgeを公開 オンデバイスでロボット制御

NVIDIA、Jetson Thor向け4BパラメータのCosmos 3 Edgeを公開 オンデバイスでロボット制御

Jetson Thor搭載ロボット向けに4BのCosmos 3 Edgeを公開。RoboLab120タスクで成功率22.9%。

developer.nvidia.com
LeRobot v0.6.1公開 VLA各方策の共通コンポーネント整理が中心、lerobot.typesはlerobot_typesに改名

LeRobot v0.6.1公開 VLA各方策の共通コンポーネント整理が中心、lerobot.typesはlerobot_typesに改名

LeRobot v0.6.1がリリース。PI0/PI0.5/EO1/SmolVLA等の共通VLAコンポーネントを整理する破壊的変更あり。

github.com
論文『RISE』、World Action Modelの想像計算量を場面ごとに動的配分する手法を提案

論文『RISE』、World Action Modelの想像計算量を場面ごとに動的配分する手法を提案

World Action Modelの未来シミュレーション量を場面ごとに動的調整するRISEをNAVSIM/nuScenesで検証。

arxiv.org