テクノロジー
4DSynth、文章や写真1枚から編集可能な4D環境を生成 VLM2種はベンチマークの過半を失敗
出典: arXivhttps://arxiv.org/abs/2608.26947公開:
原文を読む
3行まとめ
1
自然言語の記述・間取りマスク・写真1枚のいずれかを入力に、明示的な幾何、動くアクター、衝突のない軌道、物理シミュレーション可能な状態を持つ編集可能な4D環境を生成する
2
アニメーション・カメラ計画・レンダリング・タスク生成を複数シーンで統一的に扱う表現を提示
3
付属の航法ベンチマーク4DSynth-Navでは、3段階の難易度で評価したVLM 2種がいずれも過半のタスクに失敗した
要約
身体を持つエージェントの学習には、見た目が多様で、物理的に相互作用でき、時間とともに変化する環境が要る。4DSynthは、自然言語の記述・間取りのマスク・写真1枚のいずれかを入力として、明示的な幾何、動くアクター、衝突のない軌道、そして物理シミュレーションに載せられる状態までを備えた編集可能な4D環境を手続き的に合成する。アニメーション、カメラ計画、レンダリング、タスク生成を複数シーンにまたがって同じ表現で扱える点が中心的な主張である。
評価用に用意された航法ベンチマーク4DSynth-Navでは、3段階の難易度で試した視覚言語モデル2種がいずれも過半のタスクに失敗した。著者らが強調するのは手続き的に制御できることの効用で、失敗が再現可能であり、難易度の軸を1つずつ独立に動かせる。前日までのCLAPやPAWBenchが「世界モデルが物理的にどれだけ整合しているか」を測る側の議論だったのに対し、こちらは検証用の環境そのものを生成側で用意する試みにあたる。
出典: arXivhttps://arxiv.org/abs/2608.26947公開:
原文