NPU(Neural Processing Unit)は、ニューラルネットワークの計算、特に学習済みモデルを動かす「推論」を専用に処理するプロセッサです。スマートフォンやノートPCの頭脳にあたるSoC(CPUやGPUなどを1チップにまとめた半導体)に組み込まれ、CPUやGPUより少ない電力でAIを動かすために使われます。
NPUとは:CPU・GPUとの違い
ニューラルネットワークの計算の大半は、大量の掛け算と足し算の繰り返し(行列演算)です。CPUはどんな処理でもこなせる汎用プロセッサで、GPUは並列計算が得意ですが消費電力が大きくなります。NPUはこの行列演算に回路を絞り込み、INT8など精度を落とした数値形式で計算することで、電力あたりの処理量を高めています。
そのため得意分野ははっきりしています。バッテリーで動く端末の上で、AI処理を長時間・常時動かす用途です。一方で、大規模なモデルの学習はNPUの役割ではなく、データセンターのGPUなどが担います。性能の目安としてはTOPS(1秒あたりの演算回数を兆単位で表した値)がよく使われますが、数値形式などの測定条件がメーカーごとに違うため、単純には比べられません。
何に使えるのか
端末の中でAIを処理できるため、データをクラウドに送らずに済みます。これにより、通信の遅延を抑えられる、ネットワークなしでも動く、データを外に出さずに済むといった利点があります。代表的な用途は、カメラ画像の処理、音声認識、ビデオ会議での背景ぼかし、端末上で動く小さめの言語モデルなどです。
用途はPCやスマホだけではありません。AMDは2026年8月の「Embedded Computing Summit 2026」で、センサーの情報をもとに機器を制御する「フィジカルAI」向けに、CPUとNPUを1つにまとめる構成を提案しました。従来はマイコン(MCU/MPU)に外付けのNPUやGPUをPCI ExpressやSPIでつなぐ構成が多く、「認識→推論→決定→行動」という制御ループをどれだけ速く回せるかが課題になっていました。この分野の市場規模について、AMDは2035年に2000億ドルと示しています(AMD自身の見通しです)。
使い方:エンジニア向け
NPUを直接プログラムすることはほとんどなく、OSやメーカーが用意する推論ランタイムを通して使います。例えばApple製品ではCore ML、IntelのNPUではOpenVINO、Windowsでは各社NPUに対応したONNX Runtimeなどが入口になります。
一般的な流れは、学習済みモデルをONNXなどの形式に変換し、必要に応じてINT8などに量子化してから、ランタイムにNPUでの実行を指定する、というものです。NPUが対応していない演算を含むモデルは、その部分がCPUやGPUで処理されて速くならないことがあります。導入前に、使いたいモデルが対象のNPUとランタイムで実際にどこまで動くかを確認するのが確実です。
料金:いくらかかるのか
NPUはSoCに内蔵されているのが普通で、単体の部品として買ったり、クラウドのように使った分だけ払ったりするものではありません。費用はNPUを載せた端末やチップの価格に含まれていて、NPUの分だけを取り出した価格は通常公開されていません。事業で使う場合は、クラウドAIのAPI料金と比べて、端末側で処理する分だけ通信費や従量課金が減るかどうか、という観点で検討することになります。
誰が作っているのか:主なメーカーと競合
スマートフォン向けではQualcomm(Snapdragon)やApple(Neural Engine)、PC向けではIntel、AMD、QualcommがNPU内蔵のプロセッサを出しています。Qualcommは2026年9月22日にSnapdragon 8 Elite Gen 6系を発表し、CPUはブースト時に最大5GHzに達しました。ただし、NPUの性能値は当サイトの記事では扱っていません。
投資の観点では、NPU単体よりも「どのSoCに載り、どの端末とOSのAI機能を支えているか」で競争が起きています。組み込み機器では、AMDのようにCPUとNPUを統合する提案が出ており、外付けのアクセラレータとの競合が今後の焦点の1つです(筆者の見立てです)。


