用語解説 ロボットきばんモデル

ロボット基盤モデルとは

ロボット基盤モデルとは、映像や言語による指示を受け取ってロボットの動作を出力する、汎用の事前学習済みAIモデルです。仕組みと使い方、KDDI×RLWRLDやugoの国内事例、料金の現状、主な開発企業を解説します。

ロボット基盤モデルとは、大量のロボット動作データや映像、言語データで事前学習し、1つのモデルでさまざまな作業に対応できるようにしたAIモデルです。カメラ映像と「この商品を棚に並べて」のような言葉の指示を受け取り、ロボットの動作を出力します。この点が、文章を生成する大規模言語モデル(LLM)との違いです。

ロボット基盤モデルとは:従来のロボット制御との違い

これまでの産業用ロボットは、作業ごとに動作を一つひとつプログラムするか、特定の作業専用にモデルを学習させるのが一般的でした。ロボット基盤モデルでは、まず汎用のモデルを事前学習で作り、それを現場のデータで追加学習して個別の作業に合わせます。ロボットが実世界で動くAIをまとめて「フィジカルAI」と呼ぶことが多く、ロボット基盤モデルはその中核にあたります。

最大の課題はデータです。テキストと違い、ロボットの動作データはインターネット上にほとんど存在しません。そのため、現場で実際にデータを集める取り組みが開発の中心になっています。

使い方:データ収集と追加学習のサイクル

エンジニアにとっての基本的な流れは、「現場でデータを集める」「モデルを学習・改善する」「改善したモデルをロボットに戻す」の繰り返しです。

ugoが2026年9月16日に発表した「ugo Physical AI Fabric」は、このサイクルをそのまま製品にしたものです。セミヒューマノイド「ugo Nova」、データ収集キット、「ugo Data Factory」、「ugo Model Lab」で構成され、ロボットを現場で動かしながらデータをため、そのデータで学習したモデルを再びロボットへ戻す仕組みを提供します。

活用事例:小売店舗の品出し

事業会社にとって分かりやすい例が、KDDIと韓国のフィジカルAI企業RLWRLDの共同開発です。経済産業省とNEDOの「GENIAC」に採択された小売・物流向けのロボット基盤モデルの研究開発で、KDDI本社内のローソン店舗で作業者目線の映像を約3500時間集め、バックヤードから棚までの品出しを自動化するモデルを作ります。KDDIは2030年までに、接客を伴わない付帯作業のロボット化を目指しています。

この事例から分かるとおり、最初に狙われているのは、繰り返しが多く人手不足になりやすい裏方の作業です。

料金:公開された価格はまだ少ない

当サイトで確認できた範囲では、ロボット基盤モデルの利用料金やugo製品群の価格は公開されていません。現時点では、決まった価格表から選ぶ段階ではなく、ベンダーとの共同開発や実証実験の形で導入するのが中心だと考えられます(これは筆者の推測です)。費用はモデル本体だけでなく、ロボット本体、データ収集、追加学習にもかかる点に注意が必要です。

開発企業と競合:誰が作っているのか

国内では、上で紹介したKDDI×RLWRLDの連合や、ハードウェアからデータ基盤まで一体で提供するugoが動いています。海外では、Google DeepMindの「RT-2」、NVIDIAの「Isaac GR00T」、米Physical Intelligenceの「π0」などが代表的です。

競争の軸は、モデルの性能に加えて「どれだけ質の高い現場データを集められるか」にあります。投資の観点では、実店舗や現場を持つ企業と組んでデータを確保できているかが、各社を比べる材料になります。

ロボット基盤モデルに関する記事

2 件