AIの「推論(inference)」とは、学習を終えたモデルに新しいデータを入力し、答えや予測を出させる処理のことです。ChatGPTに質問して返事が返ってくるまでの計算や、画像認識AIが写真に写っているものを判定する計算が推論にあたります。
推論とは:「学習」との違い
AIの開発と運用は、大きく「学習(training)」と「推論」の2段階に分かれます。学習は、大量のデータでモデルのパラメータを調整する工程です。大規模な計算を一度にまとめて行います。推論は、できあがったモデルを動かす工程です。ユーザーのリクエストが来るたびに実行されます。
学習は開発時の計算で、推論はサービスを使ってもらうための計算です。利用者と利用回数が増えるほど推論の計算量は増え続けるため、AIを事業として運営するコストの中心は推論に移っていきます。
なお、似た言葉に「推論モデル(reasoning model)」があります。こちらは回答の前に段階的に考える処理を行うタイプのモデルを指し、上で説明した「推論=inference」とは意味が異なります。検索結果で両方が混ざることがあるので注意してください。
推論の使い方:エンジニア・企画担当向け
推論を利用する方法は主に2つあります。
1つ目はクラウドのAPIを呼び出す方法です。AI企業が運用するモデルにHTTPでリクエストを送り、結果を受け取ります。自前でサーバーを用意する必要はありません。チャットボット、文書要約、問い合わせの分類などは、この形で組み込まれることが多い使い方です。
2つ目はモデルを自社のサーバーや端末で動かす方法です。データを外部に出したくない場合や、応答速度を細かく管理したい場合に選ばれます。ただし、GPUなどの計算資源を自分で用意し、運用する必要があります。
推論の料金:何で決まるのか
APIで大規模言語モデルを使う場合、料金は処理したデータ量(トークン数)で課金されるのが一般的です。入力と出力で単価が分かれていることが多く、モデルが大きく高性能になるほど単価も上がります。具体的な金額は事業者やモデルによって違い、改定もあるため、各社の最新の料金表を確認してください。
自社で運用する場合、コストの大半はハードウェアと電力です。そのため「同じ処理をどれだけ少ない台数・電力でこなせるか」が、チップやサーバーを選ぶときの大事な基準になります。
誰が作っているのか:推論をめぐる競争
推論の需要が増えるなかで、計算基盤の確保と効率化の競争が起きています。
CNBCは9月18日、OpenAIとAnthropicが20〜30MW規模の既存データセンターの確保を探っていると報じました。両社はギガワット級の巨大拠点にも投資していますが、完成には年単位の時間がかかります。推論は小さなクラスターに分けて実行できるため、目先の需要は電源を確保済みの中小施設で賄う狙いです。報道によると、Anthropicは英国と北欧で打診したとされています。
チップの分野では、富士通が9月14日、国内で設計・開発したCPU「FUJITSU-MONAKA」を11月から世界で販売すると発表しました。富士通は、AI推論で一定時間に処理できる量が他社CPUの2倍で、同じ処理に必要なサーバー台数と消費電力を半減できると説明しています。これはあくまで同社の説明で、第三者による検証結果ではありません。
推論はGPUだけでなく、CPUや専用チップでも実行できます。投資の観点からは、AIモデルの開発企業だけでなく、データセンター、電力、半導体といった推論を支える周辺の産業にも競争が広がっている点が重要です。

