強化学習(Reinforcement Learning)とは、AIが環境の中で行動を試し、得られる「報酬」が最大になる行動の選び方を学ぶ機械学習の手法です。正解ラベル付きのデータを大量に用意する教師あり学習とは違い、人は「何が良い結果か」を報酬として決めるだけです。そこに至る手順は、AIが試行錯誤で見つけます。
強化学習とは:仕組みと基本用語
強化学習は「エージェント(学習するAI)」「環境」「状態」「行動」「報酬」の5つで成り立ちます。エージェントは今の状態を見て行動を選び、環境から次の状態と報酬を受け取ります。これを何度も繰り返し、長い目で見た報酬の合計が大きくなるように行動の方針(方策、policy)を直していきます。
ほかの手法との違いは2点です。1つは、目先の報酬だけでなく将来の報酬まで計算に入れることです。もう1つは、まだ試していない行動を試す「探索」と、良いと分かっている行動を選ぶ「活用」のバランスを取る必要があることです。
何ができるのか:代表的な用途
代表的な用途はゲームと機械の制御です。Google DeepMindの囲碁AI「AlphaGo」は、強化学習を中心技術としてトップ棋士に勝ちました。ロボットの動作制御や在庫・物流の最適化のように「行動→結果→評価」を繰り返す問題も、強化学習の対象です。
最近は大規模言語モデル(LLM)の調整でも重要になっています。RLHF(人間のフィードバックによる強化学習)は、人による評価を報酬として使い、対話AIの応答を人の好みに近づける手法です。
使い方:エンジニアが始めるには
最初に「状態・行動・報酬」を決め、エージェントが何度でも試せる環境を用意します。現実の世界で何万回も失敗させられない場合は、シミュレーターを作ってその中で学習させるのが一般的です。
Pythonには次のようなオープンソースのライブラリがあります。
- Gymnasium:学習環境の標準的な作り方を定めたライブラリ - Stable-Baselines3:PPOやDQNなど主なアルゴリズムを実装したライブラリ - Ray RLlib:分散学習向けのライブラリ
実務で最も難しいのは報酬の設計です。報酬の決め方がまずいと、AIが本来の目的を果たさないまま、抜け道を使って報酬だけを稼ぐことがあります。
料金:いくらかかるのか
強化学習は手法の名前なので、それ自体に料金はかかりません。上で挙げたライブラリも無料で使えます。費用がかかるのは次の3つです。
- 学習に使う計算資源(GPUなど) - シミュレーション環境を作る費用 - 報酬の設計や結果の評価にかかる人手
試す回数が増えるほど計算費用も増えます。事業で検討するときは、「環境を作れるか」「何回試せるか」を最初に見積もるのが現実的です。金額は規模によって大きく変わるため、この記事では示しません。
誰が作っているのか:主要プレイヤー
研究と応用の中心は、Google DeepMindやOpenAIなどのAI研究機関と大手テック企業です。その周りでは、学習用のデータや環境を売る企業も伸びています。当サイトの報道によると、AI向けの学習データセットとシミュレーション環境を提供する米Snorkel AIは、評価額35億ドルで3億5000万ドルを調達しました。年間収益ランレートは3億7500万ドルに達しています。
学習用の環境や評価データが、それだけで事業になり始めていることを示す動きだと当サイトは見ています(推測)。ただし、Snorkel AIの売上のうち強化学習向けがどれだけかは、確認できていません。

