OpenVLA

Kim 2024 · 論文

一行要約 — OpenVLAは、Open X-Embodimentからの97万件の実世界ロボットデモンストレーションで学習された70億パラメータのオープンソース視覚-言語-行動モデルであり、はるかに大きな非公開のVLAに匹敵するか、それを上回りながら、コンシューマ向けGPUでも効率的にファインチューニングできる。

問題

インターネット規模の視覚言語データと多様なロボットデモンストレーションで事前学習された大規模なポリシーは、ロボットに新しい行動を教える手段として——新しい行動をゼロから学習する代わりに汎用的な視覚-言語-行動(VLA)モデルをファインチューニングするという——新しい方法を約束していた。しかし、その普及は2つの点で妨げられていた——既存のVLA(RT-2など)はほとんどが非公開で、アーキテクチャ、学習手順、データ構成への可視性が限られていたこと、そして先行研究は実用上重要なステップである、コモディティハードウェア上での新しいタスクへの効率的なファインチューニング方法を探求していなかったことである。OpenVLAはこの両方の障壁を取り除くことを目指した。

手法とアーキテクチャ

実験結果

SLAMにおける意義

OpenVLAは参照実装となるオープンVLAであり、それに続く多くのロボット学習研究の基盤モデルであって、70億パラメータのオープンモデルがはるかに大きな非公開システムを上回れることを示した。SLAMコミュニティにとっては2つの意味で重要である: SigLIP/DINOv2式の基盤特徴をロボット知覚バックボーンとして妥当性を示したこと、そして新興の自律性スタックにおける行動側を定義したこと——SLAMが位置推定と計量マップを提供し、VLAが知覚と言語から物理的な行動へのループを閉じる、という構図である。

関連ノート