Clio
Maggio (MIT SPARK) 2024 · 論文
一行要約 — Clio はリアルタイムでタスク駆動型のオープンセット3Dシーングラフを構築する: 自然言語で与えられたタスクに基づき、逐次的な Agglomerative Information Bottleneck によって3Dプリミティブをクラスタリングし、タスクが必要とする粒度で物体と領域のみをマップに保持する。
問題
クラス非依存のセグメンテーション(SAM)とオープンセット埋め込み(CLIP)により、ロボットのマップはもはや数十〜数百のクラスに制限されず——「膨大な物体と数え切れない意味的変種」を含むことができる。これにより本論文が直接提起する疑問が生じる: ロボットがマップに含めるべき物体や意味概念の適切な粒度は何か? ピアノを運ぶロボットはそれを1個の物体としてマップすべきだが、それを演奏するロボットは鍵盤を必要とし、それを調律するロボットは弦とピンを必要とする。既存のオープンセットパイプラインは、セグメント関連付けの閾値を調整することで暗黙的に粒度を選んでいる。Clio は、この選択は本質的にタスク依存であり、マッピングシステム自体によって行われるべきだと主張する。
手法とアーキテクチャ
Information Bottleneck の形式化。 タスクリスト (CLIP で埋め込まれた自然言語の指示)とタスク非依存のプリミティブ (3D物体セグメントと障害物のない場所)は圧縮問題を定義する: タスクに関連するクラスタ 、すなわち割り当て を見つけ、次を解く。
これはタスクとの相互情報量を保存しつつ を圧縮し、 が圧縮とタスク関連性のトレードオフを制御する。
Agglomerative IB。 クラスタはプリミティブとして初期化される; 各ステップで、最小のマージ重みを持つ隣接クラスタのペア
がマージされる( = Jensen-Shannon 発散)。停止条件は、情報損失の割合
が閾値 を超えたときである。タスク関連性の分布 は、各プリミティブと各タスクの CLIP 埋め込み間のコサイン類似度 から得られ、ヌルタスク(スコア )によって拡張される: ヌルタスクに最も類似したプリミティブは背景として事前に刈り込まれ、上位 個のタスク類似度のみが(再重み付けされて)保持され、ランキングを強調する。
Incremental IB。 クラスタリングはプリミティブグラフの連結成分上で分解でき、 は成分ごとに計算可能であるため、新しい測定によって影響を受けた成分のみが再クラスタリングされる——したがって計算量は環境の大きさとともに増大せず、オンライン動作が可能になる。
システム。 フロントエンドは RGB-D ストリームに対して FastSAM と CLIP を実行し、セグメントを時間的に3D物体プリミティブトラックへ関連付け(コサイン類似度 、3D IoU 、Khronos に従う)、Hydra の GVD ベースの場所サブグラフを構築し、各場所にその重心が見える全画像の平均 CLIP 埋め込みを割り当てる。バックエンドは物体プリミティブグラフ(エッジ = 重なるバウンディングボックス)上で逐次 Agglomerative IB を実行してタスクに関連する物体を生成し、場所グラフ上でも同様に実行して場所を意味的な領域にクラスタリングする; すべてのノードはその CLIP 埋め込みを保持するため、グラフは言語で問い合わせ可能なままである。
実験結果
- オープンセット物体検索(独自収集の注釈付き3シーン、Office、Apartment、Cubicle、それぞれ目標物体27/28/18個): Clio-batch/Clio-online はほぼすべての指標で1位または2位であり、F1 は0.55–0.80(batch)であるのに対し、タスク情報を持つ ConceptGraphs は0.39–0.55、タスク非依存の ConceptGraphs は0.25–0.39である。
- コンパクトさ: Clio は48–131個の物体をマップするのに対し、自身の未クラスタリングのフロントエンド(Clio-Prim)は1070–1880個を保持する——IB クラスタリングによる1桁の圧縮でありながら、検索精度は向上する。
- 速度: フレームあたり約0.23–0.31秒で、ConceptGraphs(2.0–8.1秒)よりも約6倍速く、オンラインで動作する; 5番目のデータセットは5階建ての大学の建物をカバーする。
- クローズドセットの健全性チェック(Replica、8シーン): Clio-batch は37.95 mAcc / 36.98 F-mIOU に達し、ConceptGraphs の40.63 / 35.95に対して、タスク駆動のクラスタリングがクローズドセット性能を劣化させないことを示す。
- 領域: 部屋のラベルをタスクとして用いると、Clio(平均埋め込み)は意味的に定義された Office(F1 0.76対0.70)と Building(0.81対0.78)シーンで Hydra の純粋に幾何学的な部屋分割を上回るが、幾何学的に明確な Apartment(0.90対0.69)では幾何的な Hydra が勝る。
- ロボットデモ: アームを持つ Boston Dynamics Spot 上でのリアルタイムオンボードマッピング; 場所グラフ上でダイクストラ法により最も類似度の高い物体へナビゲートしながら、7試行にわたる言語指示による把持。
SLAMにおける意義
Clio は「すべてを固定された意味的粒度でマップする」から「タスクが必要とするものをマップする」への移行を示している——これは SLAM が身体性を持つ AI と融合する上での重要な考え方である。その IB の形式化は、粒度の問題に閾値調整ではなく、原理的な情報理論的基盤を与え、逐次的な成分ごとのソルバーは基盤モデルの意味論(FastSAM、CLIP)がオンボード計算上のリアルタイム計量意味マッピングスタックの中に存在できることを示している。言語駆動のロボットにとって、タスク条件付きのシーングラフは、計画とマニピュレーションに十分な情報を保ちながらマップをコンパクトに保つ。
関連ノート
- Kimera / 3D Dynamic Scene Graph
- Hydra
- ConceptGraphs
- Khronos — Clio の物体プリミティブフロントエンドを提供する
- CLIP
- SAM