基盤モデルのための
強化学習

和地瞭良著『基盤モデルのための強化学習』の表紙

INTRO講演スライド

本書は、第28回情報論的学習理論ワークショップ(IBIS 2025)で行ったチュートリアル講演「深層基盤モデルのための強化学習:驚きから理論にもとづく納得へ」をもとに、内容を整理・拡充したものです。本書の内容が気になる方は、まずは以下の講演スライドをご覧ください。

01目次

本編

  1. 第1章はじめに
    • なぜいま「基盤モデルのための強化学習」を学ぶのか
    • 本書の立場
    • 本書の構成
  2. 第2章強化学習の基礎
    • 強化学習とは枠組みである
    • 強化学習問題の定式化
    • 強化学習アルゴリズムの基礎
  3. 第3章基盤モデルを改良するための強化学習問題
    • 「基盤モデルを改良するために強化学習を使う」とはどういうことか?
    • 基盤モデルを改良するために強化学習はどのフェーズで用いられるか?
    • なぜ強化学習が必要なのか?
    • 基盤モデルのための強化学習問題の定式化
    • 最適解が実は分かっている
    • 最適解の解釈
    • 他のダイバージェンスを用いた定式化とその最適解
    • 多目的・制約付き最適化における Reverse KL ダイバージェンスの利点
    • 状態遷移を伴うマルコフ決定過程を用いた定式化と最適解
    • 最適解を獲得する難しさ
    • 報酬は具体的に何を表すか?
  4. 第4章強化学習による人間の主観的な選好への適合
    • 人間の主観を報酬で表現することの難しさ
    • 選好データ
    • Bradley-Terry モデル
    • Reinforcement Learning from Human Feedback(RLHF)
    • Direct Preference Optimization(DPO)
    • Reinforcement Learning from AI Feedback(RLAIF)
    • モデル開発におけるアライメント手法の潮流
    • 単一報酬による最適化の限界
  5. 第5章強化学習による客観的な正解をともなうリーズニング能力の改善
    • Reinforcement Learning with Verifiable Rewards(RLVR)
    • 検証可能な報酬の具体例
    • RLVR のための強化学習アルゴリズム
    • RLVR の役割とは?
  6. 第6章主観的かつ客観的に良い LLM を獲得するには
    • 主観と客観の両立の必要性
    • 事後学習の「レシピ」
    • Llama 3
    • Phi-4
    • DeepSeek-R1-Zero
    • DeepSeek-R1
    • Tülu 3
  7. 第7章言語から他のモダリティへ
    • 画像
    • 視覚言語モデル(VLM)
    • 音声
    • Vision-Language-Action(VLA)モデル
  8. 第8章推論時スケーリングと強化学習の関連性
    • 学習からテスト時推論へ
    • 推論時スケーリング
    • 推論時スケーリング手法
    • Best-of-N(BoN)の理論
    • BoN と強化学習における報酬の過剰最適化の実験的検証
  9. 第9章Agentic RL
    • Agentic RL とは
    • Agentic RL の定式化
    • Agentic RL によるコア能力の向上
    • Agentic RL の主な応用領域
    • Agentic RL の事例紹介
  10. 第10章今後の課題
    • 報酬ハッキング
    • 計算効率の低さ
    • 難易度の高いタスクにおける適用限界
    • 安全性

02サンプルコード

本書には、あえてサンプルコードを掲載していません。この分野はライブラリの更新が速く、紙面に載せたコードの動作を刊行後も保証し続けることが難しいためです。この分野は高品質なサンプルコードやノートブックが充実しています。ソースコードを読みながら勉強したい方は、以下のリンクを参考にすると良いでしょう。特に、Unsloth は Google Colab 上で動く Jupyter Notebook を提供しておりおすすめです。


本書で記載した数式と実装の間に距離があると感じる方もいるかもしれません。その際には、副教材として要点をまとめましたので参考にして下さい。

本書の対応箇所 手法 本書 副教材 TRL NeMo RL Unsloth
4.4節 RLHF(報酬モデルの学習) 解説 GitHub ↗ GitHub ↗ —
4.4節 RLHF(PPO) 解説 GitHub ↗ GitHub ↗ —
4.5節 DPO 解説 GitHub ↗ GitHub ↗ Colab ↗
4.5節 IPO 解説 GitHub ↗ — —
4.5節 KTO 解説 GitHub ↗ — Colab ↗
5.3節 GRPO 解説 GitHub ↗ GitHub ↗ Colab ↗
5.3節 DAPO 解説 GitHub ↗ GitHub ↗ Colab ↗
5.3節 Dr. GRPO 解説 GitHub ↗ — —
5.3節 GSPO 解説 GitHub ↗ GitHub ↗ —

03正誤表

現在、掲載している正誤情報はありません。

誤りやお気づきの点がありましたら、著者までメールでお知らせください。