MoE(Mixture of Experts、混合エキスパート)とは、AIモデルの内部を「エキスパート」と呼ぶ複数の部分ネットワークに分け、入力ごとにその一部だけを動かす設計方式です。モデル全体のパラメータ数を大きくしながら、1トークンの処理で実際に行う計算の量を抑えられます。
MoE とは:仕組みの要点
MoE モデルは、複数のエキスパートと、処理をどのエキスパートに回すかを決める「ルーター(ゲート)」でできています。Transformer 系の大規模言語モデルでは、各層のフィードフォワード部分を複数のエキスパートに置き換え、トークンごとにルーターが選んだ少数のエキスパートだけを計算する構成が一般的です。
このため MoE では「総パラメータ数」と「アクティブパラメータ数(1トークンあたり実際に使う数)」が別の値になります。たとえば Mistral AI の Mixtral 8x7B は、総パラメータが約470億なのに対し、1トークンで使うのは約130億です。性能表を読むときは、どちらの数字かを確認する必要があります。
MoE で何ができるのか・使い方
利用者側から見ると、MoE だからといって使い方は変わりません。チャットや API から呼び出す点は、全パラメータを毎回使う通常の dense(密)モデルと同じです。違いが出るのは、モデルを動かす推論インフラの側です。
計算量は少なく済んでも、全エキスパートの重みはメモリに載せておく必要があります。必要なメモリ量は総パラメータ数で決まるため、GPU の台数やメモリ容量の見積もりが dense モデルとは変わります。SemiAnalysis は、MoE によってトークンごとに有効になるテンソル、物理的に近くへ置くべきもの、広い帯域が要る転送が変わったと指摘しています。そのうえで推論を Prefill・Midfill・Decode などの段階に分け、段階ごとに最適な配置が変わると解説しました。オープンウェイトの MoE モデルを自社で動かすなら、この配置が設計の中心になります。
端末側の対応も進んでいます。Qualcomm が9月22日に発表した Snapdragon 8 Elite Extreme Gen 6 は、300億パラメータ超の MoE モデルに対応します。
MoE の料金
MoE は設計方式の名前なので、MoE そのものに料金はありません。費用は、どのモデルやサービスを使うかで決まります。
原理上、同じ総パラメータ規模の dense モデルと比べると、MoE は1トークンあたりの計算量が少なくなります。一方、メモリは総パラメータ分が必要です。自前で運用する場合、コストは GPU 構成に大きく左右されます。API 経由で使う場合は、各社の料金表を確認してください。
オープンウェイトの MoE モデルは、ライセンス次第で無償で使えます。Xiaomi が公開した MiMo-V2.6 は MIT ライセンスで、商用利用・改変・再配布ができます。ただし、動かすための計算資源の費用は別にかかります。
誰が作っているのか・競合
当サイトが報じた例では、Xiaomi の MiMo-V2.6 シリーズの上位版 Pro が総パラメータ1.02Tの MoE 型です。Artificial Analysis の総合指標では、オープンウェイトモデルの首位になりました。ほかにも Mistral AI の Mixtral や DeepSeek の DeepSeek-V3 が MoE を採用しています。
競合する方式は dense モデルです。MoE は同じ計算量でより大きなモデルを持てる反面、メモリ要件とチップ間通信の設計が難しくなります。そのため投資の観点では、モデルを作る企業だけでなく、MoE の推論を効率化する側(データセンター向けの推論ハードウェアや、スマートフォン向け SoC など)も関わる領域です。


