用語解説 ブイエルエー

VLAとは

VLA(Vision-Language-Action)モデルは、カメラ画像と言葉の指示を受け取り、ロボットの動作を直接出力するAIモデルです。何ができるか、どう使うか、費用の考え方、主な開発企業と競争のポイントを、エンジニア・企画担当・投資家向けにまとめました。

VLA(Vision-Language-Action)モデルとは、カメラ画像(Vision)と自然言語の指示(Language)を受け取り、ロボットの動作(Action)を直接出力するAIモデルです。画像と言葉を扱うAIモデルの仕組みをロボット制御に広げたもので、「フィジカルAI」やロボット基盤モデルの中心となる技術です。

VLAとは:従来のロボット制御と何が違うのか

従来のロボットは、物体の認識、動作の計画、制御を別々のプログラムで組み、作業ごとに人が動きを教え込むのが一般的でした。VLAはこれを1つのモデルにまとめます。「赤いカップを棚に置いて」という指示と現在の映像から、関節の角度やグリッパーの開閉といった次の動作を出力します。

強みは、ウェブ上の画像やテキストから学んだ知識をロボットの動作に活かせる点です。Google DeepMindが2023年に発表したRT-2は、画像と言葉を扱うモデルに「動作」を出力させる方式を示し、この分野の代表例になりました。

VLAの使い方:エンジニアが試すには

公開モデルを使う場合、流れは大きく3段階です。まず公開されている重み(学習済みのパラメータ)を入手します。次に、自分のロボットで集めた操作データ(映像・指示・動作の組)で追加学習します。最後に、GPUを載せた計算機からロボットへ動作の指令を送ります。スタンフォード大学などが公開したOpenVLAや、Physical Intelligenceのπ0(openpiとして公開)で、この流れを試せます。

VLAだけでロボットが完結するわけではありません。筆者の見解では、衝突回避や実時間の制御は、既存の動作計画・制御ソフトと組み合わせる設計が現実的です。実際、Qualcommはロボットアーム制御の定番オープンソース「MoveIt」を開発するPickNikの買収で合意し、AIモデルから動作計画、実時間制御までをまとめて開発しやすくする狙いを示しています。

VLAの料金:費用はどこにかかるのか

VLAに共通の料金体系はありません。OpenVLAやπ0のような公開モデルは重みを無償で入手できますが、学習や推論に使うGPU、ロボット本体、自社作業のデータ収集には費用がかかります。筆者の見立てでは、実務で最も大きなコストになりやすいのはデータ収集の工数です。商用サービスの具体的な価格は確認できていないため、ここには書きません。

企画・DX担当者にとっての検討対象は、ピッキング、仕分け、組立時の位置合わせなど、対象物や状況のばらつきが大きく、従来の動作教示では手間がかかる工程です。国内では、Highlandersが経済産業省とNEDOの「GENIAC」でロボット基盤モデルの研究開発に採択されました。同社のヒューマノイド「N」を使い、自動車製造の位置合わせ工程で性能を検証します。

VLAは誰が作っているのか:主な開発企業と競合

- Google DeepMind:RT-2、Gemini Robotics - NVIDIA:人型ロボット向けのGR00T N1 - Physical Intelligence:π0 - Figure:自社の人型ロボット向けのHelix - 大学・研究コミュニティ:OpenVLAなどの公開モデル

筆者の分析では、競争のポイントは2つです。1つは、多様なロボットや作業のデータをどれだけ集められるか。もう1つは、推論を実機の上で十分に速く回せるかです。ロボットメーカー、半導体企業、基盤モデル企業が、それぞれの強みを持って参入しています。

VLAに関する記事

2 件