GPUサーバーとは、GPU(Graphics Processing Unit)という半導体を積み、大量の計算を同時に処理できるようにしたサーバーです。主な用途はAIモデルの学習と推論で、CPUだけのサーバーでは時間がかかりすぎる計算を短い時間で終わらせるために使われます。
GPUサーバーとは:CPUサーバーとの違い
CPUは、少数の高性能なコアで複雑な処理を順番にこなすのが得意です。GPUは単純な計算をする小さなコアを大量に持ち、同じ種類の計算を一度に処理します。ディープラーニングの計算の大半は行列の掛け算の繰り返しなので、GPUの作りとよく合います。
1台に複数枚のGPUを積み、GPU同士を高速な配線でつなぐ構成が一般的です。大規模なAIモデルの学習では、こうしたサーバーを多数束ねて使います。電気を多く使い熱も多く出るため、CPUサーバー以上に電源と冷却の設計が重要になります。
GPUサーバーで何ができるのか
代表的な用途は、生成AIや大規模言語モデルの学習とファインチューニング、学習済みモデルを動かす推論(チャットボットや画像認識など)です。科学技術計算、シミュレーション、3Dレンダリングにも使われます。
事業会社が手を付けやすいのは、既存のモデルを自社データで調整する使い方や、社内向けに推論の環境を持つ使い方です。モデルをゼロから学習させるには、これとは桁違いの計算資源が要ります。
GPUサーバーの使い方
手に入れる方法は2つあります。1つはAWS、Google Cloud、Microsoft Azureなどのクラウドで、GPU付きの仮想サーバー(インスタンス)を必要な時間だけ借りる方法です。もう1つは、サーバーを買って自社のサーバールームやデータセンターに置く方法(オンプレミス)です。
エンジニアの作業は、GPUドライバーと開発環境(NVIDIA製GPUならCUDA)を入れ、PyTorchなどの機械学習フレームワークからGPUを呼び出すのが基本の流れです。クラウドでは、これらを入れ済みのイメージが用意されていることが多く、環境構築の手間を減らせます。
GPUサーバーの料金の考え方
料金はGPUの種類・枚数・利用時間で大きく変わるため、この記事では具体的な金額を載せません。最新の価格は各社の料金ページで確認してください。
クラウドは時間単位の従量課金で、初期費用がかかりません。ただし長く使い続けると割高になりがちです。オンプレミスは購入費が大きく、電源・冷却・設置場所の費用も別にかかりますが、稼働率が高ければ割安になる可能性があります。まずはクラウドで試し、常に大量に使うようになったらオンプレミスや長期契約を検討する、というのが判断の目安です。
誰が作っていて、競合は何か
AI向けGPUはNVIDIAが大きなシェアを持ち、CUDAを中心とするソフトウェアの蓄積が強みです。対抗としてAMDがGPUを出しており、Google(TPU)やAWS(Trainium)のようにクラウド大手が自社設計のAI向けチップを用意する動きもあります。
GPUサーバーを置くデータセンターへの投資も膨らんでいます。当サイトではこれまでに次のニュースを報じました。
- JERAが参画する、千葉市の総額2.3兆円のAIデータセンター計画 - データセンター事業者Virtusによる24.5億ポンドの資金調達 - 横河電機が参画した、シンガポールでの熱帯向けAIデータセンター実証
これらの動きから、GPUサーバーを増やすうえでは電力の確保と冷却が制約になっている、というのが当サイトの見立てです(推測を含みます)。


