ローカルLLMとは、大規模言語モデル(LLM)をクラウドのAPI経由ではなく、手元のPCや自社サーバーで動かす使い方です。入力した文章は外部サービスに送られず、使った量に応じた課金も発生しません。
ローカルLLMとは:クラウドのAIとの違い
ChatGPTのようなクラウド型サービスでは、事業者のデータセンターでモデルが動き、利用者はネット越しに結果を受け取ります。ローカルLLMでは、学習済みのモデルのファイル(重み)を自分でダウンロードし、自分のマシンで動かします。
そのため、重みが公開されている「オープンウェイト」のモデルを使います。代表例は、AlibabaのQwen、MetaのLlama、GoogleのGemma、Mistral AIのモデルです。社外秘の文書の要約や社内検索、ネットにつながらない環境など、データを外に出せない用途で選ばれます。
使い方:VRAM容量と量子化がカギ
動かすときに最も重要なのは、GPUのメモリ(VRAM)の容量です。モデル全体がVRAMに載らないと、速度が大きく落ちます。そこで「量子化」という手法を使い、パラメータを4bitや8bitに圧縮してメモリの使用量を減らします。精度は多少落ちますが、より大きなモデルを、より速く動かせるようになります。
GIGAZINEは、VRAM 32GBのIntel Arc Pro B70 Creator 32GB(ASRock製)で速度を検証しました。Qwen3.8 27Bの4bit量子化版は23.4tok/s、8bit版は15.9tok/sでした。同じモデルでも、量子化の度合いで速度がはっきり変わります。
実行ツールとしては、llama.cpp、Ollama、LM Studioなどが広く使われています。モデルを選んでダウンロードすれば、チャット形式ですぐ試せます。
料金:API代の代わりにハードウェア代がかかる
ローカルLLMには利用料がかかりません(商用で使う場合は、モデルごとのライセンス条件を確認する必要があります)。コストの中心は、ハードウェア代と電気代です。
先ほどのIntel製グラフィックボードは、30万円未満でVRAM 32GBを確保し、27Bクラスのモデルを実用的な速度で動かしました。東京ゲームショウ2026では、マウスコンピューターがクリエイター向けPC「DAIV CX」を使ってローカルLLMのデモを行いました。このPCはAMD Ryzen AI Max+を搭載し、128GBのユニファイドメモリーのうち最大96GBをVRAMに割り当てられます。このデモでは、情報漏えいのリスクと従量課金が論点として取り上げられました。
以下は筆者の見立てです。利用量が多いほど、費用が固定のローカルが有利になります。反対に、利用が少ない場合や最新の高性能モデルが必要な場合は、クラウドAPIのほうが安く済む可能性があります。
誰が作っていて、競合は何か
ローカルLLMは3つの層で成り立っています。1つ目はモデルを公開する開発元(Alibaba、Meta、Google、Mistral AIなど)、2つ目は実行ツールの開発者、3つ目は大容量メモリを供給するハードウェア企業です。上の事例のとおり、ハードウェアではIntelやAMDも大容量VRAMを強みにした製品を出しています。
競合は、OpenAI、Anthropic、Googleなどが提供するクラウドのAI APIです。企業は、性能と手軽さを取るならクラウド、データの管理とコストの固定を取るならローカル、という軸で選ぶことになります。用途ごとに両方を使い分ける構成も可能です。

