事後学習 (Post-training)の定義
事後学習(ポストトレーニング)とは、大量の文章で基礎を学び終えた大規模言語モデル(LLM)に追加の学習をさせ、指示に従う力や安全性を高める仕上げの工程のことです。英語では post-training と言います。
- 英語表記
- post-training(ポストトレーニング)。前段の工程は pre-training(事前学習)です
- 主な手法
- SFT(お手本の回答で学ばせる教師ありファインチューニング)、RLHF(人の評価をもとにした強化学習)、DPO(好みのデータで直接最適化)、RLVR(正誤を検証できる報酬による強化学習)
- 代表的な初期例
- OpenAIのInstructGPT(2022年3月の論文)。GPT-3にSFTとRLHFを行い、13億パラメータのモデルの回答が1750億パラメータのGPT-3より好まれました
- 公開レシピの例
- Tülu 3(2024年11月)。SFT、DPO、RLVRを組み合わせ、データ、コード、手順をすべて公開しています
- 最近の例
- Z.aiのGLM-5.3(2026年8月)は、GLM-5.2と同じ土台のモデルに事後学習を重ねるだけで性能を伸ばしました
事後学習 (Post-training)とは(詳しく解説)
事後学習 (Post-training) とは、 大量の Web テキストで基礎能力を仕込む事前学習 (Pre-training) の後に、 人間の意図に沿った応答へモデルを調整する追加学習フェーズの総称。 代表的な手法は 教師ありファインチューニング (SFT)、 人間のフィードバックを報酬信号にする RLHF、 より軽量な DPO の 3 つで、 これらを組み合わせて 指示追従性・安全性・対話の自然さを底上げする。 事前学習だけのモデルは 「次の単語を予測するだけ」 で 対話には使いにくいため、 事後学習は 製品化に不可欠な工程とされる。 2026 年時点の実運用では、 汎用モデルへの事後学習は 提供元がまとめて担い、 自社での実施は 高度な計算資源とデータ整備コストがかかるため 一部の大企業に限られるとされる。 現場で選ぶ際の相場感は、 フルの事後学習ではなく LoRA 等の軽量追加学習や プロンプト設計 + RAG で 十分なケースが大半で、 まず既存モデルの事後学習済みバージョン (例: Instruct 版) をそのまま使うのが現実的な入口とされる。
事後学習 (Post-training)のよくある質問
Q. 事前学習と事後学習の違いは?
事前学習は、大量の文章から言葉や知識の基礎を身につける段階です。事後学習はその後に行う仕上げで、質問への答え方や指示への従い方、安全な振る舞いを教えます。
Q. 事後学習ではどんな手法が使われますか?
お手本の回答で学ばせるSFTと、人の好みを反映させるRLHFやDPOが代表的です。最近は、数学やコードのように正解を確かめられる課題で鍛えるRLVRも加わっています。
Q. 事後学習済みのモデルはどう見分けますか?
モデル名に Instruct や Chat が付いているものが、事後学習を終えた対話向けのモデルです。Base と付くものは事前学習だけのモデルで、そのままでは会話に向きません。
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「事後学習 (Post-training)とは」 https://aipicks.jp/glossary/post-training
事後学習 (Post-training)の使用例
- このモデルは事前学習のみでファインチューニングしていない、 という説明を見たら 対話用途にはまだ不向きな段階と理解する。
- モデル名に Instruct や Chat と付くバージョンは 事後学習済みで、 素の Base モデルより対話に適しているとされる。
事後学習 (Post-training)に関連するAIツール
事後学習 (Post-training)の関連記事
事後学習 (Post-training)の関連用語
12カテゴリ・1775語以上を体系的に整理しています
