Muon (最適化アルゴリズム)
読み: みゅーおん
最終更新: 2026-07-22・AI PICKS編集部
定義
Muonとは、隠れ層の重み行列の勾配更新をNewton-Schulz反復で直交化して適用する、大規模言語モデルの事前学習向け最適化アルゴリズムのこと。
Muon (最適化アルゴリズム)とは — 詳しく解説
Muonは、隠れ層の2次元重み行列に対する勾配更新をNewton-Schulz反復で直交化する最適化アルゴリズムで、2024年後半にAdamWの代替として提案された。少ないステップ数で損失を下げられるとされ、nanoGPTの学習速度コンペで採用されたことをきっかけに注目が広がり、Moonshot AIのKimiなど大規模言語モデルの事前学習に採用された例が公開されている。2026年時点の実運用では、埋め込み層や出力層のような1次元・非正方の重みには従来通りAdamWを併用するハイブリッド構成が一般的で、全パラメータをMuonだけで最適化する設計は現場では少数派とされる。学習率やウォームアップの最適値がAdamWとは異なるため、既存の学習パイプラインへそのまま移植するとハイパーパラメータ探索のコストが余計にかさむ点が導入時の落とし穴だ。直交化処理自体の計算コストは無視できないが、収束の速さで相殺できるケースが多いと報告されている。新規に大規模モデルを事前学習する際の選択肢として検討されることが多いアルゴリズムといえる。
Muon (最適化アルゴリズム)の使用例
- PyTorchの学習ループでAdamWをMuonに置き換え、隠れ層は直交化更新、埋め込み層と出力層はAdamWのまま残すハイブリッド構成にする。
- 既存のAdamW設定からMuonへ移行する際は、学習率とウォームアップステップを個別にチューニングし直す。
Muon (最適化アルゴリズム)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・863語以上を体系的に整理しています
辞典トップへ