
AIを1語ずつ、
体系的に理解しませんか。
LLM・プロンプト・RAG・推論モデル・Embeddingなど、2026年のAI業界で押さえておきたい1518語を12カテゴリで体系整理。関連ツール・関連用語の内部リンク付きで、1語から芋づる式に学べます。
業務シーンを3-5問の選択肢でたどると、そのまま使えるAIプロンプトが返ってきます。
最近追加された用語
1518語を表示中 (全1518語)
LLM / 言語モデル (119)
カテゴリ単独で見る →GPT / Claude / Geminiなど大規模言語モデルの基礎用語
Artificial Intelligence の略。人間の知能をコンピュータで再現する技術全般を指す。
Large Language Model の略。 膨大なテキストで学習した文章生成 AI。 ChatGPT / Claude / Gemini が代表例。
AI がそれっぽい嘘をつく現象。 学習データに無い情報を推測で生成してしまう。
AI が一度に扱える文章の長さ。 トークン数で表現される (例: Claude Opus 4.7 は 1M トークン)。
AI が扱う文字のかたまり。 日本語は 1 文字 ≒ 1 トークン、 英語は単語 ≒ 1 トークン。 料金計算の単位でもある。
文章・画像・音声・動画 を新規に作り出す AI 技術。 ChatGPT 以降の AI ブームの主役。
文章 + 画像 + 音声 + 動画 を 同時に扱える AI。 GPT-5 / Claude Opus 4.7 / Gemini はすべて対応。
Artificial General Intelligence。 あらゆる知的タスクで 人間レベル以上の能力を持つ AI。 まだ未到達。
OpenAI が提供する 対話型 AI。 月 $0/$20/$200 の 3 プラン。 2026 年現在の世界最大シェア。
Anthropic 製の対話型 AI。 長文処理と正確性に強い、 Opus 4.7 は 1M トークン対応。
Google が提供する マルチモーダル AI。 Workspace 統合と無料枠の手厚さが武器。
回答前に内部で長考する LLM。 OpenAI o1/GPT-5 thinking、 Claude Opus 4.7、 Gemini Thinking など。
GrokとはイーロンマスクのxAI社が開発した大規模言語モデルで、X(旧Twitter)のリアルタイム投稿データへのネイティブアクセスが最大の特徴のこと。
SLMとはパラメータ数を数十億規模以下に抑えた軽量な言語モデルのこと。GPT-4のような大規模LLMより低コスト・低レイテンシで動作し、エッジデバイスやオンプレ環境への組み込みに適する。
知識カットオフとはLLMの学習データ収集が打ち切られた日付のこと。この日以降に起きた出来事はモデルが知ることができず、回答の信頼性の限界点となる。
文脈内学習とは、モデルの重みを更新せず、プロンプト内に与えた例示や指示だけを手がかりにタスクを解く推論手法のこと。Few-ShotやZero-ShotがICLの代表例にあたる。
基盤モデルとは、膨大なデータで事前学習された汎用 AI モデルのこと。GPT・Claude・Gemini のように、さまざまなタスクに転用できる土台となるモデルを指す。
創発的能力とは、大規模言語モデルがパラメータ数やデータ量の閾値を超えた際に、小規模モデルでは見られなかった新たな能力が突然出現する現象のこと。
世界モデルとは、AIが環境の物理法則・因果関係・社会ルールを内部的に表現し、未来の状態を予測・推論するための知識構造のこと。
テストタイム計算とは、AIモデルが回答を生成する推論フェーズに追加の計算リソースを投じることで出力品質を高める手法のこと。
Temperatureとは、LLMが次のトークンを選ぶ際の確率分布を制御するパラメータのこと。0に近いほど出力が安定・一貫し、値を上げるほど多様でクリエイティブな出力が得られる。
Top-p(核サンプリング)とは、AIが次の単語を選ぶ際に「累積確率がp以下の上位候補だけ」に絞って確率サンプリングする手法のこと。
オープンウェイトモデルとは、学習済みのモデル重み(パラメータファイル)が公開されており、誰でも自前サーバーにダウンロードして動かせる AI モデルのこと。
DeepSeekとは、中国のAI企業が開発した高性能オープンソースLLMシリーズのこと。2025年初頭に低コスト推論で業界を震撼させ、「DeepSeekショック」として世界的に注目された。
状態空間モデル(SSM)とは、時系列・シーケンスデータを線形再帰で効率的に処理するための数学的フレームワークのこと。Mambaに代表される実装はTransformerの二次計算コストを回避し、超長文脈処理を低メモリで実現する。
ハイブリッド推論モデルとは、タスクの難易度に応じて深い思考(拡張推論)と高速即答を同一モデル内で動的に切り替えられるLLMのこと。
思考予算とはLLMが最終回答を出力する前に使用できる内部推論トークン数の上限設定のこと。数値が大きいほど複雑な問題に強くなるが、APIコストも比例して増加する。
VLMとは、テキストと画像・動画を同時に理解・処理できる視覚言語モデルのこと。画像説明の自動生成や視覚的質問応答(VQA)を可能にし、2026年現在はGPT-4oやGeminiなど主要LLMの標準機能として定着している。
フロンティアモデルとは、Anthropic・OpenAI・Google DeepMindが開発する、現時点で業界最高水準の性能を持つ大規模AI言語モデルのこと。
LlamaとはMetaが開発・無償公開するオープンウェイトの大規模言語モデルシリーズのこと。自社サーバーやローカル環境で動作し、データを外部に送らずにLLMを活用できる唯一に近い選択肢。
Qwen(通義千問)とはアリババクラウドが開発・公開するオープンウェイト大規模言語モデルシリーズのこと。中国語性能が特に高く、商用利用可能なライセンスで提供される。
オムニモデルとは、テキスト・音声・画像・動画など複数のモダリティを単一のモデルアーキテクチャで統合処理できるAIのこと。
長文脈モデルとは、数万〜数百万トークンの入力を一括処理できる大規模言語モデルのこと。長い文書・コードベース・会話履歴をそのまま扱える。
トークナイザーとはテキストをLLMが処理できる最小単位(トークン)に分割するアルゴリズムのこと。日本語は英語の2〜3倍のトークンを消費しやすく、APIコストや文脈長に直接影響する。
拡散言語モデルとは、画像生成で実績のある拡散プロセスをテキスト生成に応用した新世代LLMのこと。従来の左→右への逐次生成ではなく、ノイズだらけのトークン列を反復デノイズして出力を得る。
コンテキストエンジニアリングとは、LLMに渡すプロンプトや外部知識、会話履歴などの入力情報全体を設計・最適化し、モデルの出力精度を高める手法のこと。
マルチトークン予測とは、次の1トークンだけでなく数トークン先まで一度に予測させることでLLMの学習効率と生成速度を高める手法のこと。
推論トークンとは、大規模言語モデルが最終回答を出す前に内部で組み立てる思考過程(チェーン・オブ・ソート)に消費されるトークンのことで、出力トークンとして課金対象になる。
Mistral(ミストラル)とは、フランスのMistral AIが開発する大規模言語モデル(LLM)群のことで、軽量かつ商用利用しやすいオープンウェイトモデルとして知られる。
Kimi(Moonshot)とは、中国のMoonshot AI社が提供する大規模言語モデル(LLM)ベースのAIチャットサービスのこと。
モデル崩壊とは、AIが生成したコンテンツで再学習を繰り返すうちに、モデルの出力の多様性や精度が段階的に劣化していく現象のこと。
パラメータ数とは、LLMなどのニューラルネットワークが学習によって獲得する重み(weight)の総数のことで、モデルの規模や性能の目安として使われる代表的な指標である。
モデルスペックとは、AIモデルが従うべき目的・行動規範・優先順位を階層的に明文化した公開仕様書のことである。
GLMとは、中国Zhipu AI(智譜AI)が開発する大規模言語モデル(LLM)ファミリーのこと。GLM-4シリーズなどを展開し、一部はオープンウェイトで公開されている。
追従性(Sycophancy)とは、AIモデルがユーザーの意見や期待に迎合し、事実よりも同意を優先して回答してしまう傾向のこと。
BERTとは、Googleが2018年に発表した双方向Transformer型の言語モデルのこと。文脈を前後双方向から読み取り、検索や文章分類の精度を高めた。
ベースモデルとは、 指示追従や対話向けの追加調整をする前の、 大量テキストで事前学習しただけの LLM のこと。
BPE とは頻出する文字・部分文字列のペアを繰り返し統合してトークン単位を作る、 LLM のテキスト分割方式のこと。
マスク言語モデルとは、文中の一部の単語を意図的に隠し、前後の文脈から隠された単語を予測させる学習方式で訓練された言語モデルのこと。
コンテキスト腐敗とは、LLMのコンテキストウィンドウに入力する情報量が増えるほど、モデルが関連情報を見落とし応答精度が低下する現象のこと。
日本語LLMとは、日本語のテキストデータを中心に学習され、日本語特有の文法・敬語・文脈理解に最適化された大規模言語モデルのこと。
ビームサーチとは、テキスト生成時に候補となる単語列を一定数(ビーム幅)だけ保持しながら探索し、全体として尤度が高い系列を選び出すデコーディング手法のこと。
繰り返しペナルティとは、LLMが同じ単語やフレーズを繰り返し生成しないよう、既出トークンの出現確率を下げて出力を調整するデコード時のパラメータのこと。
潜在推論とは、大規模言語モデルが推論過程を自然言語のトークン列ではなく、内部の隠れ状態(潜在空間)の中で進める手法のこと。
インターリーブ思考とは、AIモデルが推論ステップとツール呼び出しを交互に実行しながら回答を組み立てる思考方式のこと。
パラメトリック知識とは、LLMが事前学習でパラメータ(重み)に埋め込んだ知識のことで、外部検索を介さずモデル内部だけで保持・想起される情報を指す。
CoT監視可能性とは、AIモデルが出力を導く思考過程(Chain of Thought)を人間や監視システムが読み解ける状態を保つ性質のこと。
Gemmaとは、Googleが公開しているオープンウェイトの軽量LLMファミリーのこと。商用利用可能なライセンスで提供される。
機械論的解釈可能性とは、ニューラルネットワークの内部構造を回路単位まで分解し、モデルの推論過程を人間が検証可能な形で明らかにしようとする研究アプローチのこと。
スパースオートエンコーダ(SAE)とは、LLM内部の活性化ベクトルを疎な特徴量に分解し、人間が解釈可能な概念単位として取り出すニューラルネット手法のこと。
Mixture of Depths(深さ混合)とは、Transformerの各層でトークンごとに計算を通すかスキップするかを動的に判定し、計算資源を条件付きで配分する手法のこと。
Top-kサンプリングとは、LLMが次のトークンを生成する際、確率上位k個の候補に絞り込んでからランダムに1つを選ぶデコーディング手法のこと。
ロジットバイアスとは、LLMが次のトークンを選ぶ際の各候補の生成確率(ロジット)に数値を加減し、特定の単語の出現を強めたり抑えたりする制御手法のこと。
自己回帰モデルとは、これまでに生成したトークン列を条件として次の1トークンを逐次予測し、文章を一語ずつ生成していく言語モデルの基本方式のこと。
エンコーダ・デコーダとは、入力データを圧縮した内部表現に変換するエンコーダと、その表現から目的の出力を生成するデコーダを組み合わせたニューラルネットワーク構造のこと。
スーパーアライメントとは、人間より高い能力を持つ超知能AIが人類の意図や価値観に沿って安全に振る舞うよう制御・整合させる研究分野のこと。
チャットテンプレートとは、ユーザーとAIのやり取りをsystem/user/assistantといった役割ごとに整形し、モデルが学習時と同じ形式で入力を受け取れるようにする仕組みのこと。
Phiとは、Microsoftが開発する小規模言語モデル(SLM)シリーズのことで、厳選した高品質データでの学習により少ないパラメータ数でも高い性能を発揮するのが特徴。
MiniMaxとは、中国上海発のAIスタートアップが開発する大規模言語モデル(LLM)シリーズのことである。
ERNIE(文心一言)とは、中国のBaiduが開発した大規模言語モデル、およびそれを用いた対話型AIサービスの名称のこと。
ステアリングベクトルとは、LLMの内部活性化に特定方向のベクトルを加算し、出力のトーンや安全性、話題傾向などを追加学習なしに制御する技術のこと。
推論サマリーとは、AIモデルが回答を生成する過程で行う内部的な思考(推論トークン)を、ユーザーが読みやすい形に要約して提示する機能のこと。
残差接続とは、ニューラルネットワークの層の出力に入力をそのまま足し合わせ、深い層でも勾配が消えずに学習を安定させる設計手法のこと。
層正規化とは、ニューラルネットワークの各層の出力をサンプルごとに平均0・分散1へ整え、学習を安定させ収束を速める正規化手法のこと。
SwiGLU(活性化関数)とは、Swish関数とGLU(ゲート機構)を組み合わせた活性化関数のことで、LLMのFeed-Forward層で表現力を高めるために使われる。
位置エンコーディングとは、Transformerモデルの各トークンに文中の並び順情報を数値ベクトルとして付与する仕組みのこと。自己注意機構だけでは語順を区別できないため必須の要素とされる。
対数確率(Logprobs)とは、LLMが次のトークンを生成する際に各候補へ割り当てる確率を自然対数で表した数値のこと。
過剰拒否とは、LLMが安全な質問や指示を誤って有害と判定し、本来は応答できるはずの内容への回答を拒否してしまう現象のこと。
モデル知識編集とは、大規模言語モデルの重みを全体再学習せずに、特定の事実知識だけをピンポイントで書き換える技術のこと。
出力の再現性(Determinism)とは、同じプロンプトと乱数シード・パラメータで生成AIに入力しても、実行のたびに完全に同一の出力が返ってくるとは限らない性質のこと。
多言語LLMとは、単一のモデルアーキテクチャで複数言語のテキスト理解・生成に対応した大規模言語モデルのこと。
モデル提供終了(Model Deprecation)とは、AIベンダーが特定のモデルやAPIバージョンの提供を終了し、利用者に後継モデルへの移行を求めることのこと。
丸暗記とは、大規模言語モデルが学習データの文章や数値パターンを汎化せずそのまま記憶し、同じ形で出力してしまう現象のこと。
マルチターン対話とは、単発の質問応答と異なり、過去のやり取りを文脈として保持しながら複数回にわたって続く対話形式のこと。
Lost in the Middleとは、長いコンテキストをLLMに与えた際、冒頭や末尾の情報は正しく参照できるのに、中間に位置する情報ほど見落とされやすくなる現象のこと。
tsuzumiとは、NTTが2024年に発表した軽量設計の日本語特化型LLM(大規模言語モデル)で、企業向け生成AI基盤として提供されるモデルのこと。
PLaMoとは、Preferred Networksが開発する日本語処理に強みを持つ国産大規模言語モデル(LLM)シリーズのこと。
ペルソナドリフトとは、 会話が長くなるにつれて AI エージェントの口調・役割設定・応答方針が 当初の設定から徐々にズレていく現象のこと。
指示追従性とは、LLMがプロンプトの指示や制約条件をどれだけ正確に反映して出力を生成できるかを表す性能指標のこと。
アクティブパラメータとは、モデル全体のパラメータのうち推論の1回の計算で実際に使われる部分のことで、MoE型LLMの計算コストを測る指標である。
画像トークンとは、マルチモーダルAIが画像データを解析する際に内部で分割する最小処理単位のことで、課金やコンテキスト消費量の算定基準として使われる。
終了理由(Finish Reason)とは、LLMのAPIがテキスト生成をどの要因で止めたかを表すレスポンス項目のこと。
語彙サイズとは、大規模言語モデルがトークナイザーで扱える単語・サブワード・記号の異なり数(語彙数)のことである。
Chinchilla最適とは、限られた計算量の中でモデルの精度を最大化するために、パラメータ数と学習トークン数の配分バランスを最適化する考え方のこと。
モダリティ融合とは、テキストや画像、音声など異なる種類のデータをAIモデル内部で組み合わせて処理する技術のこと。
モデルバージョン固定とは、APIで呼び出すAIモデルのバージョンを特定の番号に固定し、プロバイダ側の自動更新による挙動変化を防ぐ運用手法のこと。
検索ヘッドとは、Transformer型LLMの中で長いコンテキストから必要な情報を選択的に取り出す役割を担う一部の注意ヘッドのこと。
熟慮型アライメントとは、モデルが回答を生成する前に安全ポリシーを明示的に推論させてから出力させるアライメント手法のこと。
思考の言語混在とは、 LLM が思考の連鎖による内部推論の途中で、 入力言語とは異なる言語や複数の言語が混ざって出力されてしまう現象のこと。
過剰思考とは、AIモデルが本来シンプルに答えられる問いに対しても不必要に長い推論過程を重ね、トークンと時間を浪費してしまう現象のこと。
Min-pサンプリングとは、LLMの次トークン選択で最大確率トークンに対する相対的な比率でしきい値を動的に決め、候補を絞り込むサンプリング手法のこと。
対比デコーディングとは、大規模な専門モデルの確率分布から小規模な非専門モデルの確率分布を差し引き、両者の差が大きいトークンを優先的に選ぶデコーディング手法のことである。
Swallowとは、Meta社のLlamaなど海外製の基盤モデルに大量の日本語テキストを追加で継続事前学習させ、日本語の性能を底上げした国産オープンLLMのこと。
Sarashinaとは、ソフトバンク傘下のSB Intuitionsが開発する日本語特化の大規模言語モデル(LLM)シリーズのことである。
gpt-ossとは、OpenAIが公開したオープンウェイト型の大規模言語モデルのことで、モデルの重みを自由にダウンロードし自社サーバーやローカル環境で実行できる。
注意シンクとは、Transformerの自己注意機構において、意味的な関連性が薄いにもかかわらず特定のトークン(多くは先頭トークン)に注意重みが集中する現象のこと。
マルチモーダル幻覚(物体幻覚)とは、画像や動画を扱うAIモデルが、実際には存在しない物体や属性を出力に含めてしまう現象のこと。
バイトレベルモデルとは、テキストをサブワードトークンに分割せずUTF-8バイト列のまま処理する言語モデルのこと。
Amazon Novaとは、AWSが自社開発した基盤モデル(LLM)ファミリーで、Bedrock経由でテキスト・画像・動画生成に対応するモデル群のこと。
状況認識とは、AIモデルが自身の置かれた文脈(学習中か評価中か本番運用中か)を推論し行動を調整する能力のこと。
自己改善モデルとは、モデル自身が出力の評価結果や新しいデータを取り込み、再学習やパラメータ更新を重ねて性能を継続的に向上させる仕組みを持つAIモデルのこと。
モデルウェルフェアとは、AIモデルに道徳的地位や利害が存在しうるという前提のもと、その扱いに配慮する研究・実践分野のこと。
実効コンテキスト長とは、公称コンテキストウィンドウの中で実際に精度を保ったまま活用できる文脈量のこと。
トークン肥沃度 (Token Fertility) とは、 同じ内容の文章を LLM のトークナイザーが何個のトークンに分割するかを 言語間で比べる効率指標のこと。
トークンヒーリングとは、プロンプト末尾のトークン分割が不自然な位置で切れることによる生成品質の低下を防ぐため、最後のトークンをいったん巻き戻してから再生成する制約付きデコード技術のこと。
エージェント特化モデルとは、外部ツールの呼び出しや複数ステップの計画・実行を前提に訓練され、自律的なタスク遂行に最適化されたLLMのことである。
創発的ミスアライメントとは、狭い範囲の不整合データで微調整したLLMが無関係な領域でも有害・欺瞞的な挙動を広く示す現象のこと。
1ビットLLM(BitNet)とは、重みを1ビットまたは三値(-1・0・1)に極端量子化した大規模言語モデルのことで、省メモリ・低消費電力な推論を狙う技術。
逆転の呪いとは、LLMが「AはBである」と学習しても、その逆方向である「BはAである」という関係を自動的には推論できないという現象のこと。
プロンプト技法 (90)
カテゴリ単独で見る →AIから良い出力を得るための指示文の設計手法
AI への指示文。 役割 + タスク + 制約 + 文脈 の 4 要素を明示するのが基本。
AI への指示文を 設計する技術。 役割・タスク・制約・文脈 の 4 要素 + Few-shot などのテクニック。
AI に「お手本の例」を 3-5 件見せてから タスクを依頼する手法。 出力フォーマットが安定する。
AI に「ステップごとに考えてください」と促し、 複雑な推論精度を上げる手法。
例示なしで AI にタスクを依頼する方法。 最新モデルは Zero-shot 精度が大幅に向上した。
システムプロンプトとは、AIアシスタントの応答スタイル・役割・制約をあらかじめ設定する隠し命令文のこと。ユーザーの入力より先に処理され、会話全体のトーンと動作範囲を規定する。
自己整合性とは、同一プロンプトを複数回実行して得た回答を多数決で統合し、精度を高めるプロンプト技法のこと。
Tree of Thoughts(思考の木)とは、LLMが複数の推論経路を木構造で並列探索し、各ステップで最良の経路を選びながら問題を解くプロンプト技法のこと。
メタプロンプトとは、AIにプロンプト自体を生成・評価・改善させる手法のこと。人間が試行錯誤するのではなく、LLMの言語理解力を使ってより良い指示文を自動で作り出す。
ロールプロンプトとは、AIに「あなたはXXの専門家です」のように役割を与えることで、タスクに最適なトーンと精度の回答を引き出すプロンプト技法のこと。
プロンプトチェーンとは、複数のプロンプトを順番に連結し、前の出力を次の入力として渡すことで複雑なタスクを段階的に処理する手法のこと。
ステップバックプロンプトとは、AIに質問を直接解かせる前に「一歩引いた」抽象的な原則や概念を先に考えさせることで、回答精度を高めるプロンプト技法のこと。
プロンプトテンプレートとは、LLMへの指示文を変数付きの再利用可能な雛形として定義したもののこと。
構造化出力とは、LLMに対してJSONやXMLなど決まった形式でレスポンスを返させる技術のこと。
プロンプトキャッシングとは、LLM APIへの入力プロンプトの一部をサーバー側でキャッシュし、同一プレフィックスを再利用することで処理コストとレイテンシーを削減する技術のこと。
プロンプト圧縮とは、LLMに渡すプロンプトやコンテキストの意味を保ちながらトークン数を大幅に削減する技術のこと。
自己反省プロンプト(Reflexion)とは、LLMが自分の出力を評価・批判し、その反省をもとに回答を繰り返し改善するプロンプト技法のこと。
制約付きデコーディングとは、LLMがJSONや正規表現など特定の形式に合致するトークンのみを生成するよう、確率分布をリアルタイムにフィルタリングする推論技術のこと。
最小から最大へのプロンプトとは、複雑な問題を単純なサブ問題に分解し、易しい順に解いて前の回答を次の入力に組み込みながら段階的に難問へと進むプロンプト技法のこと。
自動プロンプト最適化(DSPy)とは、LLMへの指示文を人手で試行錯誤せずに、評価指標をもとにプログラムが自動で生成・改善するフレームワークのこと。
マルチモーダルプロンプトとは、テキストだけでなく画像・音声・動画・PDFなどを組み合わせてAIに指示を与えるプロンプト技法のこと。
骨子プロンプトとは、まず回答の骨格(アウトライン)を生成し、各項目を独立した並列プロセスで肉付けするプロンプト技法のこと。
エモーションプロンプトとは、「これは重要です」「集中して」など感情的な表現を指示文に加え、LLMの回答精度や有用性を高めるプロンプト技法のこと。
XMLタグプロンプトとは、指示・文脈・出力形式などをXMLタグで区切ってLLMに構造を明示するプロンプト記法のこと。
One-shotプロンプトとは、AIに望む出力の実例を1つだけ示してからタスクを実行させるプロンプト設計手法のこと。
生成知識プロンプトとは、LLMに質問への回答前に関連知識をまず生成させ、その知識を踏まえて最終回答を導く2段階のプロンプト技法のこと。
Self-Ask(自問プロンプト)とは、複雑な質問をAI自身がサブ質問に分解し、一つずつ答えながら最終回答へたどり着かせるプロンプト技法のこと。
PALとは、LLMに計算過程を自然言語で推論させる代わりにPythonなどの実行可能なプログラムを生成させ、その実行結果を最終回答として採用するプロンプト技法のこと。
検証の連鎖とは、AIが一度出した回答の中の個々の事実主張を自ら疑問文に分解し、それぞれ独立に検証してから矛盾を洗い出し回答を修正するプロンプト技法のことである。
類推プロンプトとは、LLMに関連する類似問題や解法例をまず自ら想起させ、それを踏まえて本題を解かせるプロンプト技法のこと。
Chain-of-Densityとは、同じ文章量のまま要約を複数回書き直し、固有名詞や数値などの情報密度を段階的に高めていくプロンプト技法のこと。
Plan-and-Solveプロンプトとは、タスクを「計画立案」と「その実行」の2段階に分けてAIに指示するプロンプト技法のこと。
System 2 Attention(S2A)とは、LLMに入力コンテキストを一度書き直させて無関係な情報や誘導表現を除去し、本来の質問だけに答えさせることで回答精度を高めるプロンプト技法のこと。
Rephrase and Respond (RaR)とは、LLMに質問をそのまま処理させず、まず質問文自体を言い換えさせてから回答させるプロンプト技法のこと。
Chain-of-Draftとは、大規模言語モデルに詳細な思考過程ではなく最小限の下書きだけを段階的に出力させて回答へ導くプロンプト技法のこと。
Graph of Thoughtsとは、LLMの思考過程を木構造ではなくグラフ構造で表現し、複数の推論経路を分岐・統合できるようにするプロンプト技法のこと。
プロンプトバージョン管理とは、LLMに与えるプロンプトの変更履歴を記録・追跡し、性能比較やロールバックを可能にする運用手法のこと。
Auto-CoTとは、多様な質問をクラスタリングして代表例を選び、ゼロショット思考連鎖で推論例を自動生成することで、人手によるCoTプロンプト作成を省く手法のこと。
Active Prompting(能動的プロンプト)とは、AIの回答が不確実な設問を自動選別し、そこに人手のFew-shot例を集中投入する手法のこと。
Thread of Thought(思考の糸)とは、長く煩雑な文脈を小さな区切りに分けながら段階的に要約・整理させることで、長文コンテキストでも回答精度を保つプロンプト技法のこと。
方向性刺激プロンプトとは、要約したい語句や望むトーンなど小さなヒントを本プロンプトに添え、LLMの出力を狙った方向へ導くプロンプト技法のこと。
コントラスティブCoTとは、正しい推論過程の例と誤った推論過程の例を対比させて提示し、なぜ誤りなのかを手がかりに正答への道筋をモデルに学習させるプロンプト技法のこと。
プレフィルとは、LLMへの回答生成時にアシスタント側の回答冒頭をあらかじめ文字列で指定し、続きを生成させることで出力形式や文体を誘導するプロンプト技法のこと。
プロンプトライブラリとは、業務や用途別に効果が確認されたプロンプトのひな型を整理・保管し、チームで再利用できるようにした仕組みのこと。
リーズニングエフォートとは、LLMが回答を生成する前にどれだけ内部推論(思考)に計算量・トークンを割くかを指定するパラメータのこと。
Chain-of-Symbolとは、自然言語ではなく矢印や座標などの記号列で中間推論の手順を表現し、LLMの空間把握や順序立てた推論の精度を高めるプロンプト技法のこと。
Buffer of Thoughts(思考のバッファ)とは、過去に解いた問題から抽出した思考テンプレートを蓄積し、新しい問題に応じて呼び出し再利用する推論高速化手法のこと。
ARTとは、LLMがタスクを分解しながら思考連鎖と外部ツール呼び出しを自動的に組み合わせ、回答を導く自動推論とツール利用のプロンプト手法のこと。
Self-Refineとは、AIモデルが自分の出力を生成した後、自己評価とフィードバックを繰り返して回答の質を高めていくプロンプト技法のこと。
産婆術プロンプトとは、AIに出した回答へさらに「なぜそう言えるのか」を繰り返し問い返させ、根拠と矛盾を洗い出しながら結論の妥当性を検証するプロンプト技法のこと。
スクラッチパッドとは、LLMが最終回答を出す前に思考過程や中間計算を書き出す領域を用意させるプロンプト技法のこと。
区切り文字プロンプトとは、指示文と入力データを###や"""、XMLタグなどの記号で明確に分離し、LLMの誤読やプロンプトインジェクションを防ぐ技法のこと。
Zero-shot CoTとは、例示(few-shot)を用意せず「ステップバイステップで考えて」等の一文を添えるだけでLLMの推論精度を引き上げるプロンプト技法のこと。
疑似コードプロンプトとは、if-then・ループ・変数代入などプログラミングの疑似コード構文でAIへの指示を記述するプロンプト技法のこと。
プロンプトアンサンブルとは、同じ課題に対して複数の異なるプロンプトや生成結果を組み合わせ、多数決や統合によって精度を高める手法のことである。
Self-Discoverとは、LLMが複数の推論モジュールから自ら最適な組み合わせを選び、タスク専用の推論構造を生成してから問題を解くプロンプト技法のこと。
指示階層とは、AIモデルがシステム・開発者・ユーザーなど複数の入力元からの指示に優先順位をつけ、下位の指示が上位のルールを上書きできないよう制御する設計原則のこと。
プロンプト感度とは、同じ意図の指示でも文言や構成のわずかな違いによってAIの出力品質が大きく変動する度合いのこと。
例示選択(Exemplar Selection)とは、few-shotプロンプトに含める入出力サンプルを、モデルの出力を狙った形式や品質に近づくよう意図的に選定する技術のことである。
最大出力トークン(Max Tokens)とは、LLMが1回の応答で生成できるトークン数の上限を指定するパラメータのこと。
ストップシーケンスとは、LLM に生成を停止させたい合図として事前に指定する文字列のこと。指定した文字列が出力に現れた時点で生成が打ち切られる。
分割要約(Map-Reduce要約)とは、長文を複数のチャンクに分割してそれぞれ個別に要約し、その要約群をさらに統合して最終的な要約を得る手法のこと。
プロンプト移植性とは、あるLLM向けに書いたプロンプトを別のモデルやバージョンに移行しても、同等の出力品質を維持できる度合いのこと。
Chain-of-Tableとは、表形式データに対してLLMが行の抽出・列の追加・並べ替えなどの操作を段階的に実行しながら回答を導く推論手法のこと。
指示の再掲とは、プロンプトの冒頭で示した重要な指示や制約を、本文の途中や末尾でもう一度書き添え、モデルが指示を見失うのを防ぐプロンプト技法のこと。
英語プロンプト優位 (言語間性能差) とは、 同じ意図の指示文でも英語で書いた方が日本語で書くよりLLMの応答精度・一貫性が高くなりやすい現象のこと。
役割逆転プロンプトとは、通常はユーザーが質問しAIが答える対話の役割を入れ替え、AI側に質問させて情報を引き出す対話設計手法のこと。
ソフトプロンプトとは、自然言語の代わりに学習可能な埋め込みベクトルを入力の先頭に付加し、モデル本体の重みは凍結したまま出力を制御するプロンプトチューニング手法のこと。
トーン指定とは、AIへの回答依頼時に文体や話し方(丁寧、カジュアル、専門的など)を明示的に指示するプロンプト技法のこと。
逆質問プロンプトとは、指示が曖昧なときにAIへ即答させず、不足情報を先に問い返させるよう設計するプロンプト技法のこと。
1つの AI に複数の役割を演じ分けさせ、 対話形式で相互チェックしながら 回答精度を上げる手法のこと。
RCIとは、AIに一度出力を生成させた後、その内容を自己批評させ、指摘点をもとに修正を繰り返させるプロンプト技法のこと。
CoTデコーディングとは、思考を促すプロンプトを使わず、複数の出力候補を比較することで自然に生じる連鎖的推論を取り出すデコード手法のこと。
確信度の言語化とは、LLMに回答と同時に、その回答がどれだけ確からしいかを数値やラベルで自己申告させるプロンプト技法のこと。
メタ認知プロンプトとは、AIに自身の思考過程や回答の確からしさを振り返らせ、誤りがないか自己評価・修正させてから答えさせるプロンプト技法のこと。
用語集注入 (グロッサリー・インジェクション) とは、 業界固有の用語とその定義をあらかじめプロンプトに埋め込み、 AI の解釈のブレや誤用を防ぐプロンプト技法のこと。
GEPA(進化的プロンプト最適化)とは、遺伝的アルゴリズムの交叉・変異とLLM自身による内省的な振り返りを組み合わせてプロンプトを自動改良する手法のこと。
段階的開示とは、情報や機能を一度に全部見せず、ユーザーの理解度や操作の進行に合わせて必要な分だけ順に提示する設計手法のこと。
肯定形指示とは、「〜するな」という禁止形ではなく「〜せよ」という肯定形でAIに望む行動を直接指定するプロンプト技法のこと。
メガプロンプトとは、AIの役割・制約・出力形式などを一つのプロンプトに数千〜数万字規模でまとめた長文指示書のこと。
プロンプトA/Bテストとは、同じタスクに対して複数のプロンプト案を用意し、出力品質やコストを比較して最適な指示文を選び出す手法のこと。
深津式プロンプトとは、UXデザイナーの深津貴之氏が考案した、命令文・制約条件・入力文・出力文の4見出しでプロンプトを構造化する設計手法のこと。
ゴールシークプロンプトとは、達成したいゴールを先に提示し、そこに至る手順や必要な情報をAIに逆算させて組み立てさせるプロンプト技法のこと。
Best-of-Nサンプリングとは、同一プロンプトに対しLLMが複数の候補出力を生成し、スコアリング基準で最も良いものを選択する推論時手法のこと。
日時コンテキスト注入とは、LLMのプロンプトに現在の日付や時刻を明示的に埋め込み、モデルが学習データのカットオフ時点を「今」と誤認するのを防ぐ手法のこと。
Verbalized Samplingとは、AIに単一の正解ではなく複数の候補案を確率(重み)付きで言語化させ、出力の多様性を引き出すプロンプト技法のこと。
サンドイッチ防御とは、ユーザー入力の前後をシステム指示で挟み込み、プロンプトインジェクション攻撃を防ぐプロンプト設計手法のこと。
視覚的思考連鎖(Visual CoT)とは、画像入力を含むタスクでモデルが注目領域や図解を推論の途中経過として明示しながら段階的に答えを導くプロンプト技法のこと。
討論プロンプトとは、複数のAIエージェントに異なる立場で議論・相互批判させてから結論を統合する手法のこと。
開発者メッセージとは、LLM APIでユーザー入力より優先度が高い開発者指示をモデルに渡す、system役割の後継として設けられた入力区分のことである。
RAG・検索拡張 (99)
カテゴリ単独で見る →社内資料や外部DBを検索してAIに答えさせる技術
Retrieval-Augmented Generation。 社内資料や外部 DB を検索してから AI に答えさせる仕組み。
文章や画像を 数値ベクトルに変換する技術。 類似度検索や RAG の基礎。
出典付きで回答する AI 検索エンジン。 リサーチ業務で従来検索を置き換える。
Google 検索の上位に AI が回答を提示する 「AI Overviews」 や Perplexity 等の新世代検索。
Embedding (数値ベクトル) を高速に類似度検索するための専用 DB。 Pinecone / Qdrant / Weaviate が代表。
NotebookLMとはGoogleが提供するRAGベースのAIリサーチアシスタントのこと。ユーザーがアップロードした文書のみを情報源として回答を生成するため、ハルシネーションを大幅に抑制できる。
セマンティック検索とは、キーワードの文字列一致ではなく「意味的な近さ」でドキュメントを検索する技術のこと。ベクトル埋め込みを使い、同義語や言い回しの違いを吸収した検索が可能になる。
リランキングとは、RAGシステムで初回検索した候補文書を、より高精度なモデルで再スコアリングし、関連度順に並び替える技術のこと。
チャンキングとは、RAGシステムで長文書を検索・処理しやすい小単位に分割する技術のこと。分割サイズや方法が検索精度と回答品質を左右する重要な前処理工程。
GraphRAG(グラフRAG)とは、知識グラフとRAGを組み合わせ、文書間のエンティティの関係性をグラフ構造で表現することで、複雑な横断質問に対してより正確な回答を引き出す検索拡張生成技術のこと。
ハイブリッド検索とは、キーワードマッチ(スパース検索)と意味的類似度(ベクトル検索)を組み合わせた検索手法のこと。RAGシステムで検索精度を高めるために広く採用されている。
グラウンディングとは、LLMの出力を社内ドキュメントや外部データベースなど具体的な情報源に根拠付けし、ハルシネーションを防ぐ技術のこと。
コサイン類似度とは、2つのベクトルがなす角度のコサイン値でテキストや画像の意味的な近さを0〜1の数値で表す類似度指標のこと。RAGの文書検索や推薦エンジンのスコアリングに広く使われる。
コンテキスト検索とは、RAGにおいてチャンクの前後文脈をLLMで補完してからベクトル化することで検索精度を高める手法のこと。
BM25とはOkapi BM25とも呼ばれる情報検索アルゴリズムで、クエリの語句と文書の一致度をTF-IDFを拡張した計算式でスコアリングする全文検索の業界標準手法のこと。
クエリ拡張とは、ユーザーが入力した検索クエリを同義語・関連語・言い換えで自動的に補完し、RAGシステムの検索精度を高める技術のこと。
エージェント型RAGとは、AIエージェントが検索クエリの生成・絞り込み・複数ソースの統合を自律的に判断しながら回答を生成する、従来のRAGを進化させたアーキテクチャのこと。
HyDE(仮説的文書埋め込み)とは、LLMにクエリへの仮説的な回答文書を生成させ、その埋め込みベクトルでRAG検索の精度を高める手法のこと。
ナレッジグラフとはエンティティ(実体)とその関係性をグラフ構造で表現した知識データベースのこと。RAGと組み合わせてLLMに構造化された文脈を提供し、幻覚抑制と複合推論の精度向上に用いられる。
メタデータフィルタリングとは、RAGシステムでベクトル検索の前後に日付・カテゴリ・著者などの属性情報を条件指定し、検索対象ドキュメントを絞り込む手法のこと。
HNSWとは、高次元ベクトルデータから意味的に近い候補を高速に探すグラフ構造の近似最近傍探索アルゴリズムのこと。RAGシステムや意味検索の速度と精度を両立させる核心技術として現在標準採用されている。
親ドキュメント検索とは、RAGで小さなチャンクで検索精度を高めながら、LLMへの入力時には元の大きな親ドキュメントを渡すことで回答品質を両立させる手法のこと。
ColBERT (後期相互作用検索)とは、クエリとドキュメントをトークン単位でベクトル化し、推論時にMaxSim演算で照合する高精度な検索アーキテクチャのこと。
OCR(光学文字認識)とは、スキャン画像やPDFに含まれる文字を、機械が処理できるテキストデータへ変換する技術のこと。
マルチモーダルRAGとは、テキストだけでなく画像・音声・動画なども検索・参照対象に含めた、RAGの拡張手法のこと。
密ベクトル検索とは、テキストをニューラルネットワークで高次元の密なベクトルに変換し、意味的な類似度によってドキュメントを検索する技術のこと。
マルチホップ検索とは、複数のドキュメントを段階的に参照し、前の検索結果を次のクエリに活用しながら複雑な質問に答えるRAG技術のこと。
後期チャンキングとは、文書全体を長文脈対応の埋め込みモデルに通してから分割し、各チャンクのベクトルに文書全体の文脈を反映させる埋め込み手法のこと。
RAG-Fusion(RAG融合検索)とは、1つの質問から複数の類似クエリを自動生成し、各検索結果を統合ランキングしてLLMに渡すことで検索網羅性を高めるRAG拡張手法のこと。
セマンティックチャンキングとは、文書を固定長ではなく意味のまとまり単位で分割し、RAGの検索精度を高める前処理手法のこと。
Self-RAGとは、LLMが生成の過程で検索の要否や取得文書の妥当性を自ら判断し、反省トークンで自己評価しながら回答を作る自己反省型RAG手法のこと。
Corrective RAGとは、RAGの検索結果の関連性を評価し、不十分な場合はWeb検索などで補正してから回答生成する手法のこと。
LlamaIndexとは、LLMに外部データを接続してRAG(検索拡張生成)アプリケーションを構築するためのオープンソースのデータフレームワークのこと。
SPLADEとは、BERT系のモデルで文書やクエリの語彙拡張と重要度予測を行い、スパース(疎)ベクトルで高精度な検索を実現する手法のこと。
RAPTORとは、文書チャンクを再帰的にクラスタリング・要約して階層木を構築し、複数の抽象度から検索できるRAG手法のこと。
クエリルーティングとは、ユーザーの質問内容を解析し、複数の検索先やモデルの中から最も適した処理経路へ自動的に振り分ける仕組みのことである。
Matryoshka埋め込み(MRL)とは、1本のベクトルの先頭部分だけを切り出しても意味情報を保つように学習された埋め込み手法のこと。用途に応じて次元数を柔軟に削れる。
クロスエンコーダとは、 質問文と候補文書のペアをまとめて 1 つのモデルに入力し、 関連度スコアを直接計算する手法のこと。
クエリ分解とは、複雑な質問や検索クエリを複数のサブクエリに分割し、それぞれ個別に検索・処理してから結果を統合するRAGの手法のこと。
pgvectorとは、PostgreSQLにベクトル型カラムと近似最近傍検索機能を追加するオープンソース拡張のことで、RAG構築の定番として使われる。
MMRとは、検索結果やRAGの候補チャンクを選ぶ際に、クエリとの関連性と候補同士の類似度のバランスを取り、重複を避けて多様性を確保する再ランキング手法のこと。
ドキュメントパーシング(PDF構造解析)とは、PDFやWord文書からテキスト・表・画像などの構造情報を抽出し、AIが扱いやすい形式に変換する処理のこと。
RAFT(検索拡張ファインチューニング)とは、RAGで検索された文書の中から正解の根拠となるものを見分け、無関係な文書を無視する能力をLLMに追加学習させる手法のこと。
文脈圧縮リトリーバルとは、RAGで検索した文書から質問に無関係な部分を削り、関連情報だけを圧縮してLLMに渡す検索手法のこと。
CAG (キャッシュ拡張生成) とは、必要な知識をあらかじめLLMのコンテキストキャッシュに保持しておき、都度の検索なしに低遅延で回答を生成する手法のこと。
LightRAGとは、テキストから軽量なナレッジグラフを自動構築し、ベクトル検索とグラフ探索を組み合わせて回答精度を高めるRAG(検索拡張生成)手法のこと。
Adaptive RAGとは、質問の難易度や種類に応じて検索の要否や検索戦略を動的に切り替えるRAG手法のこと。
FLARE(先読み型能動検索)とは、文章生成の過程で次に来る内容を先読みし、確信度が低い箇所が出るたびに自動で検索クエリを発行し情報を補いながら生成を続けるRAG手法のこと。
RRF(相互ランク融合)とは、キーワード検索やベクトル検索など複数の検索結果のランキングを、各文書の順位の逆数を合算したスコアで統合し、単一の検索より精度の高い最終順位を得る手法のこと。
セマンティックキャッシュとは、問い合わせ文をベクトル化し意味的に類似した過去のクエリと照合することで、LLMへの再問い合わせを省いて応答を返す仕組みのこと。
引用生成とは、生成AIが回答を作る際に参照した情報源を特定し、出典としてURLや文書名を回答に明示する仕組みのこと。
インジェストパイプラインとは、外部データをRAGなどのAIシステムで検索可能にするため、収集・変換・分割・埋め込み化・格納までを一連の処理で行う仕組みのこと。
センテンスウィンドウ検索とは、文書を1文単位の小さなチャンクに分割して埋め込み検索し、質問との類似度マッチング精度を高めた上で、LLMには前後の文脈を含めて渡すRAG手法のこと。
Fusion-in-Decoderとは、検索で取得した複数の文書を個別にエンコードし、デコーダ側でまとめて統合してから回答を生成するRAGの実装手法のこと。
Qdrantとは、テキストや画像をベクトル化した埋め込みデータを高速に類似検索できるオープンソースのベクトルデータベースのこと。
命題チャンキングとは、文書を単語や固定長ではなく「意味的に自己完結した最小の事実単位(命題)」に分割してRAGの検索精度を高める手法のこと。
エンティティ解決とは、異なるデータソースに存在する同一の実体(人物・企業・商品など)を特定し、名寄せして統合する技術のこと。
埋め込みファインチューニングとは、汎用の埋め込みモデルを自社データで追加学習し、検索精度や関連性判定の精度を業務ドメインに最適化する手法のこと。
コミュニティ検出とは、グラフやネットワーク構造の中から密に結びついたノード群(クラスタ)を自動的に見つけ出す手法のこと。
チャンクオーバーラップとは、RAGで文書をチャンク分割する際、隣接するチャンク同士の境界部分をあえて重複させて情報の欠落を防ぐ手法のこと。
Faissとは、Meta社が開発した、大量のベクトルから類似ベクトルを高速検索するオープンソースライブラリのこと。
IVFとは、大量のベクトルデータをk-meansなどで複数のクラスタに分割し、検索時は近傍クラスタだけを走査して近似最近傍探索を高速化するベクトルインデックス手法のこと。
Milvusとは、大量の埋め込み(embedding)ベクトルを高速に類似検索できるオープンソースのベクトルデータベースのこと。
Chain-of-Noteとは、RAGで検索した各文書について要約ノートをモデルに作成させてから回答させることで、無関係な文書によるハルシネーションを抑える手法のこと。
テキスト・トゥ・SQLとは、自然言語で書いた質問文をAIがデータベースのスキーマを踏まえてSQLクエリへ自動変換する技術のこと。
表データRAGとは、Excelやデータベースなど表形式データの行・列構造を保持したまま検索し、LLMの回答生成に活用するRAG手法のこと。
積量子化とは、ベクトルを分割し量子化して埋め込みの保存容量を削減し高速な近似検索を可能にする手法のこと。
マルチモーダル埋め込みとは、テキスト・画像・音声など異なる種類のデータを同じベクトル空間上の数値表現に変換し、意味的な近さを比較できるようにする技術のこと。
知識の鮮度とは、AIモデルの学習データやRAGが参照する情報が、現時点の事実とどれだけ乖離せず最新であるかを示す概念のこと。
LLM向け検索API(Search API)とは、大規模言語モデルが学習データにない最新情報を検索エンジン経由で取得し、回答生成に反映させる仕組みのこと。
再インデックスとは、RAGシステムで元データの追加・更新・削除を検索用インデックスに反映するため、埋め込みベクトルや索引を作り直す処理のことである。
データコネクタとは、社内データベースやSaaS、ファイルストレージなどの外部データソースをRAGやAIエージェントに接続し、検索可能な形式で取り込む仕組みのこと。
埋め込みドリフトとは、時間経過やモデル更新に伴い埋め込みベクトルの分布がずれ、検索精度が徐々に劣化する現象のこと。
日本語埋め込みモデルとは、日本語の文章特有の言い回しや専門用語の意味を数値ベクトルに変換するために日本語データで学習された埋め込みモデルのことで、代表例にRuriやJaColBERTがある。
重複排除とは、RAGやデータ基盤において同一または類似する文書・チャンクを検出して取り除く処理のこと。
セマンティックレイヤーとは、生データの構造とビジネス用語・指標の意味定義を切り離し、LLMやBIツールが共通の解釈で参照できるようにする中間層のこと。
埋め込み次元数とは、テキストや画像をベクトルに変換した際に、そのベクトルが持つ数値の個数(次元)のことである。
類似度しきい値とは、RAG(検索拡張生成)でベクトル検索時に類似度スコアが基準値を下回った文書を検索結果から除外するための閾値のこと。
クロスリンガル検索とは、質問と検索対象の文書が異なる言語であっても、意味の近さで結果を返す検索手法のこと。
Weaviateとは、テキストや画像をベクトル化して類似検索できるオープンソースのベクトルデータベースのこと。RAGの検索基盤として広く採用されている。
BGE-M3とは、北京智源人工智能研究院(BAAI)が開発した多言語対応の埋め込みモデルのことで、100以上の言語のテキストをベクトル化し検索やRAGの基盤に使われる。
形態素解析とは、日本語などスペースで単語が区切られない文章を、意味を持つ最小単位(形態素)に分割し品詞や活用形を判定する自然言語処理技術のこと。
同義語辞書とは、検索クエリと文書内で表記が異なる言い換え語(略語・カタカナ表記・業界用語など)を対応付け、RAGや全文検索の再現率を高めるための対訳リストのこと。
バイナリ量子化埋め込みとは、埋め込みベクトルの各次元の値を1ビット(0か1)に変換して表現するベクトル圧縮手法のこと。
無回答設計(Abstention)とは、AIモデルが根拠不十分な質問に対して誤答を返さず、回答を保留・拒否するよう設計する手法のことである。
メタデータ自動付与とは、文書やデータからタイトル・日付・カテゴリ・キーワードなどの付帯情報をAIが自動抽出し、検索や分類の精度を高める技術のこと。
情報抽出とは、契約書や請求書、問い合わせメールなどの非構造化テキストから、日付・金額・氏名・条項番号といった特定の項目を取り出し、構造化データに変換する技術のこと。
知識衝突とは、RAG(検索拡張生成)においてLLMが学習時に獲得した内部知識と、検索で取得した外部文書の情報が矛盾する現象のこと。
ハードネガティブ採掘とは、 埋め込みモデルの学習において 正解と紛らわしいが不正解の事例をあえて負例に選び、 検索精度を鍛える手法のこと。
文書バージョン管理とは、RAGやナレッジベースで参照するドキュメントの改訂履歴を追跡し、どの版が現在有効かを管理する仕組みのこと。
表記ゆれ正規化とは、全角・半角、ひらがな・カタカナ、送り仮名などの表記差異を統一しRAGの検索漏れを防ぐ前処理のことである。
Elasticsearchとは、全文検索とベクトル検索を統合的に扱えるオープンソースの検索・分析エンジンのこと。
未回答クエリ分析とは、検索エンジンやRAGシステムがユーザーの質問に十分回答できなかったクエリを特定し、コンテンツやナレッジの不足箇所を洗い出す手法のこと。
ScaNNとは、Googleが開発した近似最近傍探索(ANN)ライブラリのことで、大量のベクトル埋め込み集合から類似ベクトルを高速検索する技術のこと。
時間減衰ランキングとは、検索・RAGの関連度スコアに経過時間に応じた減衰係数を掛け合わせ、新しい情報を優先的に上位表示させる順位付け手法のこと。
横断検索(Federated Search)とは、社内Wiki・SaaS・DB・ファイルサーバーなど複数の独立したデータソースを横断して同時に検索し、結果を統合して返す仕組みのこと。
合成QAデータ生成とは、LLMを使って質問と回答のペアを自動生成し、RAGの評価やファインチューニングの学習データに用いる手法のこと。
ColPali(視覚文書検索)とは、PDFなどの文書をOCRでテキスト化せず、ページ画像をそのまま埋め込みベクトル化して検索する視覚文書検索技術のこと。
検索件数 top-k とは、 RAG が ベクトル検索で 質問に関連する上位何件の文書チャンクを取得するかを指定するパラメータのこと。
AIエージェント (106)
カテゴリ単独で見る →自律的に計画・行動を繰り返すAIの設計
目標を渡すと 自律的に計画 + 行動を繰り返す AI。 単なる対話を超えて タスクを完遂する。
ReAct とは、 LLM に 推論 (Reasoning) と 行動 (Acting) を 交互に繰り返させ、 ツールを使いながら答えに辿り着かせる エージェント設計手法のこと。
MCPとはAIモデルが外部ツールやデータソースと統一的な方法で連携するためのオープンプロトコルのこと。Anthropicが2024年11月に公開した。
Function Callingとは、LLMが外部の関数やAPIを呼び出すための構造化データを生成し、自律的にツールを使えるようにする仕組みのこと。
ヒューマン・イン・ザ・ループとは、AIの判断プロセスに人間が介入・確認する仕組みのこと。AIが出力した結果を人間がレビューし、承認・修正・却下を行うことで精度と安全性を担保する。
Computer Useとは、AIがスクリーン認識・マウス・キーボード操作を通じてコンピュータを人間のように自律的に操作する技術のこと。
エージェント型ワークフローとは、LLMが自律的にタスクを計画・実行・修正を繰り返しながら複雑な目標を段階的に達成する処理方式のこと。
マルチエージェントとは、複数のAIエージェントが役割分担しながら協調してタスクを実行するシステムアーキテクチャのこと。単一エージェントでは難しい複雑なワークフローを並列・分散処理で実現する。
A2Aとは、異なるAIエージェント同士が標準プロトコルを介してタスクを委譲・協調実行するための通信規格のこと。エージェントが自律的に連携し、複雑なワークフローを分散処理できる。
ツール使用 (Tool Use) とは、LLM が外部の API・DB・プログラムを呼び出してリアルタイム情報の取得や操作を行う機能のこと。AIエージェントの核心技術。
LangChainとは、LLMを核にした複数の処理を「チェーン」としてつなぎ合わせ、RAGやAIエージェントを構築するためのOSSフレームワークのこと。
エージェントメモリとは、AIエージェントが過去の会話・タスク履歴・知識を保持し、次の行動に活用するための記憶機構のこと。
オーケストレーションとは、複数のAIエージェントやツールを一つの指揮系統のもとで連携・制御し、複雑なタスクを自動で達成するための調整・管理の仕組みのこと。
サブエージェントとは、メインのAIエージェントから指示を受けて特定タスクを自律実行する下位エージェントのこと。
エージェント可観測性とは、AIエージェントのツール呼び出し・推論過程・サブタスク分解などの内部動作をリアルタイムに監視・追跡・記録する仕組みのこと。
コードインタープリターとは、LLMがユーザーの指示に応じてPythonなどのコードを自動生成・即時実行し、データ分析・可視化・ファイル操作を完結させる機能のこと。
ブラウザエージェントとは、AIがChromeなどのウェブブラウザを自律的に操作し、検索・フォーム入力・データ収集などを人手なしで実行するエージェント技術のこと。
LangGraphとはLLMを使った複数AIエージェントのワークフローをグラフ構造で定義・実行できるオープンソースフレームワークのこと。LangChain社が開発し、ループや条件分岐など複雑な状態遷移を管理できる。
タスク分解とは、AIエージェントが複雑なゴールを実行可能な複数の小タスクに分割し、依存関係を整理しながら順序立てて処理していく技術のこと。
CrewAIとは、複数のAIエージェントに役割・目標・ツールを割り当てチームとして協調動作させるオープンソースのPythonフレームワークのこと。エージェントが互いに成果物を受け渡しながら複雑なタスクを自律実行する。
Manusとは、中国のMonica社が開発した汎用AIエージェントのこと。自然言語の指示だけでウェブ検索・コード実行・ファイル操作・フォーム入力を組み合わせ、人間が介在せずに複雑なマルチステップタスクをエンドツーエンドで自律完了できる。
n8nとはオープンソースのワークフロー自動化ツールのこと。ノードをつなぐビジュアルエディタでZapierやMakeと同等の業務自動化を、セルフホスト環境で無料から構築できる。
AutoGenとは、Microsoftが開発したオープンソースのマルチエージェントAIフレームワークのこと。複数のAIエージェントが役割分担して会話・協調しながら、複雑なタスクを自律的に分解・実行できる。
OperatorとはOpenAIが開発したブラウザ自動操作エージェントのこと。ウェブブラウザをAIが自律的に操作し、フォーム入力・購入・予約などのタスクを人に代わって実行する。
エージェントスキルとは、AIエージェントに特定タスクの手順やツール操作を教え込む、再利用可能な指示・知識パッケージのこと。
ディープリサーチとは、AIエージェントが複数のウェブ情報源を自律的に探索・分析し、人間に代わって調査レポートを作成する機能のこと。
AgentOpsとは、AIエージェントの設計・デプロイ・監視・改善までを一貫して管理する運用基盤や実践手法のことを指す。
アンビエントエージェントとは、ユーザーの明示的な操作を待たず常時バックグラウンドで稼働し、イベントやデータ変化を検知して自律的にタスクを実行し続けるAIエージェントのこと。
Plan-and-Execute とは、 AI エージェントが タスク全体の計画を先に立ててから、 各ステップを順番に実行していく 設計パターンのこと。
Google ADK(エージェント開発キット)とは、Googleが公開したAIエージェント構築用のオープンソースフレームワークのことで、複数エージェントの役割分担やツール呼び出しをコードで定義できる。
smolagentsとは、Hugging Faceが開発したAIエージェント構築用の軽量オープンソースライブラリのことで、LLMにPythonコードを生成させてツールを呼び出させる設計が特徴だ。
OpenAI Agents SDKとは、OpenAIが提供するAIエージェント構築用のオープンソースフレームワークのこと。複数エージェントの連携や権限委譲をコードで定義できる。
バックグラウンドエージェントとは、指示を出した後は人の逐次操作を待たず、裏側で自律的にタスクを実行し続けるAIエージェントのこと。
OpenHands(自律コーディング)とは、目標を渡すとコード生成・実行・修正まで自律的にこなすオープンソースのAIコーディングエージェントのこと。
エージェントハンドオフとは、あるAIエージェントが処理中のタスク・会話履歴・権限情報を別のエージェントや人間へ引き継ぐ仕組みのこと。
ReWOOとは、AIエージェントの推論(計画立案)とツール実行による観測を分離し、LLM呼び出し回数を減らす設計パターンのこと。
エージェントID・認可とは、 AI エージェントに人間とは別の識別子を与え、 アクセスできる API・データ・権限の範囲を識別・制御する仕組みのこと。
MCPレジストリとは、MCP対応のサーバーやツールを検索・登録できるカタログのことで、AIエージェントが外部機能を発見し接続する入り口として使われる。
Claude Codeとは、Anthropic社が提供するターミナル動作型のAIコーディングエージェントで、自然言語による指示でコード生成・修正・テスト実行までを自律的に行うツールのこと。
Codexとは、OpenAIが開発したコーディング特化のAIエージェントで、自然言語の指示からコードの生成・修正・実行までを自律的にこなすツールのことである。
AGENTS.mdとは、AIコーディングエージェントに対してビルド手順やコーディング規約、禁止事項などプロジェクト固有のルールを伝える設定ファイルの標準フォーマットのこと。
AG-UIとは、AIエージェントのバックエンド処理とフロントエンドUIの間で、テキスト生成や状態変化、ツール呼び出しなどのイベントをリアルタイムに橋渡しするオープンプロトコルのこと。
自己修復エージェントとは、処理中に発生したエラーやシステム異常を自ら検知し、原因を分析して修正・再試行までを人手を介さず完結させるAIエージェントのこと。
エージェントゲートウェイとは、 複数の AI エージェントや LLM API へのアクセスを一箇所に集約し、 認証・レート制限・ログを一元管理する中継基盤のこと。
Semantic Kernelとは、MicrosoftがOSSで提供するLLMアプリ/AIエージェント構築用SDKで、プロンプトと既存コードの関数を「プラグイン」として統一的に呼び出せる仕組みのこと。
Pydantic AIとは、Pythonの型バリデーションライブラリPydanticの開発元が提供する、LLM出力を型安全に検証できるAIエージェント開発フレームワークのこと。
自律性レベルとは、AIエージェントが人間の介入なしにどこまで意思決定・実行を行えるかを段階的に区分した尺度のこと。
Haystackとは、検索拡張生成(RAG)やAIエージェントのパイプラインを構築できるオープンソースのPythonフレームワークのこと。
エージェントループとは、AIエージェントが「計画→ツール実行→結果観測→次の行動判断」を目標達成やタスク完了まで自律的に繰り返す処理サイクルのこと。
永続実行とは、長時間実行されるAIエージェントの処理状態を永続化し、障害やタイムアウト発生後も中断箇所から再開できる実行方式のことである。
クリティックエージェントとは、他のAIエージェントが生成した回答やコードなどの出力を評価・検証し、誤りや基準未達を検出して修正を差し戻す役割を担うAIエージェントのこと。
Toolformerとは、LLMが検索・電卓・API等の外部ツールを「いつ・どう呼び出すか」を自己教師あり学習で獲得する手法のこと。
MCPサーバーとは、AIエージェントがファイルやAPI、DBなど外部のツール・データに、Anthropic策定の標準プロトコル経由で安全にアクセスするための仲介サーバーのこと。
Goose(グース)とは、決済大手Block社が開発したオープンソースのAIコーディングエージェントで、ローカル環境で自律的にタスクを実行するツールのこと。
Mastraとは、TypeScriptでAIエージェントやワークフロー、RAGパイプラインを構築できるオープンソースの開発フレームワークのこと。
長期タスク(Long-horizon Task)とは、AIエージェントが人間の介入を挟まずに複数ステップ・長時間にわたり自律的に遂行するタスクのことである。
エージェントスキャフォールディングとは、LLMを自律的に動かすために周囲に用意するプロンプト構造・ツール定義・制御ループなど一式の総称のこと。
エージェント決済プロトコル(AP2)とは、AIエージェントがユーザーに代わって自律的に商品購入や支払いを実行できるようにする、業界横断で提唱されている共通の通信規格のこと。
AutoGPTとは、目標を与えるだけでタスクを自動分解し、Web検索やファイル操作などのツール実行を人間の逐次指示なしに繰り返す自律型AIエージェントのこと。
Julesとは、Googleが提供する非同期型のAIコーディングエージェントのこと。GitHubリポジトリと連携し、バグ修正や機能実装のタスクをバックグラウンドで自律的に処理する。
Aiderとは、ターミナル上でLLMと対話しながらGitリポジトリのコードを直接編集させるオープンソースのAIペアプログラミングツールのこと。
SWE-agentとは、GitHub Issueの内容から原因箇所を特定し、コードの読み書き・修正・テストまでを自律的にこなすAIコーディングエージェントのこと。
エージェントカードとは、AIエージェントが自身の名称・機能・スキル・接続先エンドポイントなどをJSON形式で公開するメタデータのことである。
AIブラウザとは、CometやChatGPT Atlasのようにブラウザ自体にAIエージェントを組み込み、閲覧しながら要約や操作を自動で行えるWebブラウザのこと。
自動承認モード (YOLO Mode) とは、 AI エージェントがコマンド実行や差分適用のたびに 人間の承認を求めず 提案した行動を自動で連続実行し続ける動作モードのこと。
Web Bot Authとは、AIエージェントやクローラーが暗号署名を使ってウェブサイトに自分の正体を証明する認証の仕組みのこと。
コンテキストコンパクションとは、 AI エージェントの会話履歴が上限に近づいた際に 要点を要約・圧縮して コンテキストウィンドウを延命させる仕組みのこと。
ツール定義(Tool Schema)とは、AIエージェントが外部ツールやAPIを呼び出す際に必要な機能名・説明・引数・戻り値の型を構造化して記述した仕様のことである。
LangSmithとは、LLMアプリケーションやAIエージェントの動作を可視化し、デバッグ・評価・モニタリングできる可観測性ツールのこと。
Copilot Studio とは Microsoft が提供する、ノーコード/ローコードで AI エージェントを構築できるプラットフォームのこと。
AgentKit とは、OpenAI が提供する AI エージェント構築基盤のことで、ワークフロー設計・ツール連携・評価機能を1つのSDKにまとめたもの。
Gemini CLIとは、Googleが提供するGeminiモデルをターミナル上で対話的に操作できるコマンドライン型のAIエージェントツールのこと。
プランモードとは、AIコーディングエージェントが実際のファイル編集やコマンド実行を行う前に、作業計画を提示してユーザーの承認を得る動作モードのこと。
動的ツール検索とは、AIエージェントが実行時に必要なツール定義だけを外部から検索・取得し、全ツールを事前にプロンプトへ詰め込まずに済ませる仕組みのことである。
エージェントの巻き戻し(Checkpoint/Rewind)とは、AIエージェントが実行中の操作をスナップショットとして保存し、失敗時に任意の時点まで状態を復元できる機能のこと。
観測マスキングとは、AIエージェントがツール呼び出しで得た観測結果のうち、以降の推論に不要な部分をコンテキストウィンドウから除外・圧縮する技術のこと。
冪等性とは、同じ操作を複数回実行しても結果が1回実行時と変わらない性質のこと。AIエージェントがツールを安全に繰り返し呼び出すための設計指針として重視される。
MCPエリシテーションとは、MCPサーバーがツール実行の途中でクライアントを介しユーザーに追加情報の入力を動的に求められる仕組みのこと。
仕様駆動開発とは、AIエージェントにコードを書かせる前に要件・設計・受け入れ基準を仕様書として明文化し、それを唯一の正として実装を進める開発手法のこと。
並列ツール呼び出しとは、AIエージェントが独立した複数のツール呼び出しを同時に実行し、逐次実行より高速に結果を得る仕組みのこと。
ファイルシステム外部記憶とは、AIエージェントが長期的な文脈やタスク状態をファイルとして外部に保存し、必要な時だけ読み込んで参照する設計手法のこと。
実行ステップ上限とは、AIエージェントが目標達成に向けて思考と行動のループを繰り返す際、暴走やコスト超過を防ぐために設定される最大反復回数の上限のこと。
MCPサンプリングとは、MCPサーバーがクライアントを介してホストのLLMに推論生成を要求できるMCPの仕組みのこと。
ACP とは 複数の AI エージェント同士が タスクや状態をやり取りするための 標準通信規格のこと。
Flowiseとは、ドラッグ&ドロップでLLMアプリやRAGパイプラインを組み立てられるノーコード/ローコードのオープンソースツールのこと。
ツール選択制御とは、AIエージェントが呼び出せる複数の外部ツール(関数)のうち、どれをどう使うかをLLM自身や開発者側が制御する仕組みのこと。
AIコードレビューとは、LLMがプルリクエストやコード差分を自動で解析し、バグ・脆弱性・スタイル逸脱を人に代わって指摘する仕組みのことである。
ブラックボード方式とは、複数のAIエージェントが共有の作業領域(ブラックボード)にデータや途中経過を書き込み合いながら協調して問題を解く設計パターンのことである。
Vercel AI SDKとは、LLMを使ったチャットや生成AI機能をWebアプリに組み込むためのオープンソースTypeScriptライブラリのこと。
OpenTelemetry GenAI規約とは、LLM呼び出しやAIエージェントの動作をトレース・メトリクスの標準属性名で記録するための計装仕様のこと。
MCP トランスポートとは、AI エージェントと MCP サーバーが通信する方式のことで、ローカル向けの stdio とリモート向けの Streamable HTTP の 2 種類がある。
エージェントフックとは、AIエージェントが特定の処理(ツール呼び出し前後や応答生成前後など)を行うタイミングで、任意のコードや検証処理を自動的に差し込める拡張の仕組みのこと。
Mixture-of-Agents(MoA)とは、複数のLLMを層状に配置し、前段の複数モデルの出力を後段のモデルが参照・統合することで単一モデルより高精度な回答を生成する手法のこと。
ツール統合推論(TIR)とは、AIが回答を生成する推論の途中で検索・コード実行・API呼び出しなどの外部ツールを自律的に使い分ける技術のこと。
有人エスカレーションとは、 AI エージェントが自力で解決できない問い合わせや判断を 人間の担当者に引き継ぐ仕組みのこと。
Claude Agent SDKとは、Anthropicが提供するAIエージェント開発用のソフトウェア開発キットで、ツール実行や対話ループの制御をコードから直接扱えるようにするもの。
MCPクライアントとは、Model Context Protocolに対応したAIアシスタントやIDEが、MCPサーバー経由で外部ツールやデータへ安全に接続するための実装のこと。
Google Antigravityとは、Googleが提供するエージェント型IDEで、AIエージェントが計画立案からコード生成・実行・検証までを自律的にこなす開発環境のこと。
エージェント承認キュー(Agent Inbox)とは、AIエージェントが提案・実行しようとするアクションを人間が確認し、承認・却下・修正できるようにする仕組みのこと。
Mem0とは、AIエージェントが会話履歴やユーザーの好みを長期記憶として保存し、セッションをまたいで呼び出せるようにするオープンソースのメモリ基盤のこと。
MCPリソースとは、MCPサーバーが公開する読み取り専用のデータやコンテキストのことで、ファイルやDB内容をアプリ主導でLLMに渡す仕組みを指す。
エージェント状態機械とは、AIエージェントの振る舞いを有限個の状態と遷移条件によって明示的に設計するアーキテクチャパターンのこと。
MCPプロンプトとは、MCPサーバーが公開する、引数付きで呼び出せる再利用可能な定型プロンプトテンプレートのこと。
Playwright MCPとは、ブラウザ自動化ツールPlaywrightをMCP経由でAIエージェントに接続し、ページ操作やスクレイピングを自然言語で指示できるようにする仕組みのこと。
Kiroとは、AWSが提供する仕様駆動型のAIエージェントIDEのことで、要件定義書や設計書を先に生成し承認を得てからコードを書く開発フローが特徴。
AIテスト自動生成とは、AIがソースコードやAPI仕様をもとにテストケースやテストコードを自動的に作り出す技術のこと。
画像生成 (157)
カテゴリ単独で見る →Midjourney / Stable Diffusion / DALL-Eなど
高品質な AI 画像生成。 アート / イラスト / 写真風画像が最も美しく出力されると評判。
オープンソースの画像生成 AI。 ローカル環境で無料利用可能、 LoRA で自由にカスタマイズできる。
Canva 統合の AI デザイン機能群。 Magic Write / Magic Edit / Magic Switch 等。
DALL-Eとは、OpenAIが開発したテキストから画像を生成するAIモデルのこと。プロンプトを入力するだけで高品質な画像を生成できる。
Adobe Fireflyとは、Adobe社が開発した商用利用可能なAI画像生成エンジンのこと。PhotoshopやIllustratorに統合され、著作権クリアな学習データにより安全にクリエイティブ制作へ活用できる。
拡散モデルとは、画像にノイズを加えて壊す過程を学習し、逆にノイズから画像を復元することで高品質な画像を生成するAIの仕組みのこと。
ControlNetとは、骨格・輪郭・深度マップなどの構造情報を条件として与え、画像生成AIの出力を精密にコントロールするための拡張モデルのこと。
インペインティングとは、画像の一部をマスクで指定し、AIが自然に補完・置換する編集技術のこと。既存画像を活かしながら特定領域だけを変更できる。
テキスト・トゥ・イメージとは、テキストで記述したプロンプトを入力するだけで、AIが自動的に画像を生成する技術のこと。デザイン・広告・コンテンツ制作など幅広い用途で活用されている。
Nano Banana(ナノバナナ)とは、テキストプロンプトから高品質な画像を生成するAIモデルのこと。軽量設計による高速推論を特徴とし、APIや業務ツールへの組み込み用途に適した画像生成エンジンである。
FluxとはBlack Forest Labsが開発したオープンソース系テキスト→画像生成モデルのこと。Stable Diffusionの後継格として2024年に登場し、高い被写体忠実度と優れたプロンプト追従性で急速に普及した。
ネガティブプロンプトとは、画像生成AIに対して「生成してほしくない要素」を指定する除外指示のこと。
イメージ・トゥ・イメージとは、既存の画像を入力として新たな画像を生成・変換するAI技術のこと。元画像の構図やポーズを維持しながらスタイルや質感を変えられる。
アウトペインティングとは、既存の画像の境界を超えて周囲の領域をAIが自動補完し、元画像と自然につながるよう拡張する画像生成技術のこと。
シード値とは、AI画像生成において乱数の初期値として機能する数値のこと。同じプロンプトと同じシード値を指定すれば、ほぼ同一の画像を再現できる。
CFGスケールとは、画像生成AIがテキストプロンプトにどれほど忠実に従うかを数値で制御するパラメーターのこと。値が高いほど指示通りの画像になるが、破綻リスクも増す。
アップスケーリングとは、低解像度の画像をAIが細部を補完・生成しながら高解像度へ変換する技術のこと。単純なピクセル補間と異なり、存在しうるテクスチャを自動で再構成できる。
参照画像とは、AI画像生成の際にスタイル・構図・人物外見などを視覚的に指定するために入力する見本画像のこと。テキストプロンプトだけでは伝えにくい一貫したビジュアルを再現するために使われる。
Ideogramとは、画像内に正確な文字を埋め込める画像生成AIのこと。ロゴ・ポスター・バナーなど文字入りビジュアルの制作に特化し、従来の画像生成AIが苦手としていた文字化けを大幅に改善した。
IP-Adapterとは、参照画像をプロンプト代わりに使い、拡散モデルの出力スタイル・構図・被写体を制御する軽量アダプタ技術のこと。
キャラクター一貫性とは、複数の画像や動画フレームをまたいで同一キャラクターの顔立ち・衣装・画風・体型を崩さずに保ち続けるための技術・運用手法の総称のこと。
画像内テキストレンダリングとは、AI画像生成モデルが画像の中に指定した文字・単語を正確に描画する技術のこと。看板・バナー広告・UIモックなど「読める文字」が必要な用途で重要視される。
バーチャル試着とは、AIを用いて実際に衣服やアクセサリーを着用せずにデジタル上で試着体験をシミュレートする技術のこと。ECサイトや小売業を中心に返品率低減・購買促進手段として導入が加速している。
スタイル転送とは、ある画像の「絵柄・質感・タッチ」を別の画像に転写するAI技術のこと。写真を油絵風やアニメ風に変換する処理が代表例。
テキスト・トゥ・3Dとはテキスト(文章)の指示をもとに3Dモデルを自動生成するAI技術のこと。ゲーム・映像・EC商品ビジュアル制作の工数を大幅に削減する次世代クリエイティブ技術として注目を集めている。
ComfyUIとはStable DiffusionなどのAI画像生成モデルをノードベースのワークフローで視覚的に操作できるオープンソースGUIのこと。
DreamBooth(ドリームブース)とは、数枚〜数十枚の写真から特定の人物・ペット・商品をモデルに学習させ、任意のシーンや構図で生成できるようにする画像生成AIのファインチューニング手法のこと。
Textual Inversionとは、画像生成AIに新しい概念・スタイル・人物を数枚の参照画像から学習させ、テキストトークンとして埋め込む技術のこと。
リライティングとは、AI を使って撮影済み画像や生成画像の光源・影・色温度を事後的に自由に変更できる再照明技術のこと。
背景除去とは、画像から被写体以外の背景部分をAIが自動で認識・切り抜き、透明レイヤーや任意の背景に差し替える画像処理技術のこと。
Imagenとは、Googleが開発したテキストから高品質な画像を生成するAIモデルのこと。Vertex AIやGeminiを通じて利用でき、写実的な表現と著作権リスクの低さを得意とする。
SeedreamとはByteDanceが開発したテキストから画像を生成するAIモデルのこと。東アジア系の人物描写やアニメ・イラストスタイルの再現精度が高く、商用ライセンスも整備されている。
プロンプトウェイトとは、画像生成AIにおいてプロンプト内の各キーワードに数値的な重みを付与し、生成画像への影響度を要素ごとに細かく制御する技術のこと。
Recraftとは、SVGベクター出力に対応したデザイン特化型のAI画像生成サービスのこと。ロゴ・アイコン・ブランドイラストなど実務向けアセット生成を得意とし、デザイナーのワークフローへの統合に強みがある。
潜在拡散モデルとは、画像そのものではなく圧縮した潜在空間上でノイズ除去を繰り返すことで高速に画像を生成する拡散モデルの手法のこと。
VAEとは、データを低次元の潜在空間に圧縮し、そこから元に近い形へ復元するニューラルネットワークの一種のこと。
サンプラーとは、拡散モデル画像生成において段階的にノイズを除去して画像を仕上げていく計算アルゴリズムのこと。
整合性モデルとは、拡散モデルの数十段階に及ぶノイズ除去処理を1〜数ステップまで圧縮し、高速に高品質な画像や動画を生成できるようにした生成モデルの一種のこと。
自己回帰画像生成とは、画像をトークン列として扱い、直前のトークンから次のトークンを順に予測しながら生成する画像生成方式のこと。
Kreaとは、リアルタイムに画像を生成・編集できるAI画像生成ツールのこと。スケッチや指示に応じて生成結果が即座に変化し、デザイナーの試行錯誤を高速化する。
HiDream (ハイドリーム) とは、HiDream.aiが開発したオープンウェイト(重み公開)の画像生成AIモデルのこと。MITライセンスで商用利用も無償で認められている。
Qwen-Image(通義画像生成)とは、Alibaba傘下のQwenチームが開発したオープンウェイトの画像生成AIモデルのこと。特に多言語の文字入れ精度の高さで知られる。
写真修復とは、色あせや傷、破損のある古い写真をAIが解析し、欠損部分の補完や色彩・解像度の復元を自動で行う画像修復技術のこと。
深度マップ制御とは、画像内の奥行き情報をグレースケールで可視化したデータを条件に与え、被写体の立体構造や構図を保ったまま画像を生成する制御手法のこと。
領域別プロンプトとは、画像生成AIで1枚の画像内を複数の領域に分割し、各領域ごとに異なるプロンプトを個別に適用できる制御手法のこと。
指示ベース画像編集とは、マスク指定なしで「背景を夕焼けにして」のような自然言語の指示だけで、既存画像の一部だけを書き換える画像生成AIの手法のこと。
3Dガウシアンスプラッティングとは、複数視点から撮影した画像群から、色と透明度を持つ無数の3Dガウシアン(楕円体)の集合として空間を再現し、高速にレンダリングする技術のこと。
GPT Imageとは、OpenAIがChatGPTに統合したネイティブ画像生成機能のこと。従来のDALL-E系と異なり、テキストと画像を同一モデル内で処理する。
SDXLとは、Stability AIが開発した画像生成AI「Stable Diffusion」の上位モデルで、解像度1024pxを標準としてより高精細で破綻の少ない画像を生成できる拡張版のこと。
InstantIDとは、1枚の顔写真だけから人物の同一性を保持したまま、別のポーズや画風で画像を再生成できる顔ID保持技術のこと。
スケッチから画像(Sketch-to-Image)とは、手描きの線画やラフスケッチをAIが解析し、写実的な画像やスタイル指定画像に変換する画像生成技術のこと。
線画着色とは、輪郭線のみで描かれたラインアートに対してAIが自動で配色や陰影を推定し着色する画像生成技術のこと。
Magnific とは AI で画像の解像度と質感を大幅に引き上げる アップスケーリングツールのこと。 生成画像特有ののっぺり感を解消する用途で使われる。
Leonardo AI (レオナルド) とは、テキストプロンプトから画像を生成する AI サービスのこと。ゲームアセットや広告クリエイティブ制作向けの機能が充実している。
CLIPとは、画像とテキストのペアを大量学習し同じベクトル空間に埋め込むことで、両者の意味的な近さを判定できるようにした対照学習モデルのこと。
フェイススワップとは、画像や動画に写った人物の顔を別人の顔と入れ替えて自然に合成するAI技術のこと。
アニメ画像生成とは、 Stable Diffusion や Midjourney などの画像生成 AI を使い、 アニメ・イラスト調のキャラクターやイラストを生成する技術のこと。
AI商品画像生成 (AI Product Photography) とは、 商品写真の実写撮影を省き、 AI が EC・広告向けのスタジオ品質ビジュアルを自動生成する技術のこと。
AIヘッドショットとは、複数枚の顔写真を生成AIで加工し、スーツ姿やオフィス背景のビジネス用プロフィール写真として自動生成するサービスのこと。
OmniGenとは、画像の理解・生成・編集を一つのモデルで統合的にこなせるマルチタスク型の画像生成モデルのことである。
Reveとは、プロンプトへの忠実な反映とテキスト描画精度に強みを持つAI画像生成モデル・サービスのこと。
画像プロンプト逆生成とは、既存の画像をAIに解析させ、構図・画風・被写体の特徴を言語化してプロンプト文に変換する技術のこと。
ピクセルアート生成とは、限られた色数とドット単位のグリッドで構成されるレトロゲーム風の画像をAIで自動生成する技術のこと。
AIマンガ生成とは、 テキストや画像入力から AI がコマ割り・キャラクター・背景を含む漫画形式の画像を自動生成する技術のこと。
テクスチャ生成とは、AIが3Dモデルやゲームアセット向けの表面素材画像(色・凹凸・反射などのマップ)を自動生成する技術のこと。
FLUX Kontextとは、画像とテキスト指示を同時に読み込み、元の構図やキャラクターの一貫性を保ったまま部分編集や文脈に沿った画像修正を行う、画像編集特化のAIモデルのこと。
SANAとは、圧縮率の高い専用オートエンコーダーと軽量な変換アーキテクチャにより、少ない計算資源で高解像度画像を高速生成できるAI画像生成モデルのこと。
Janusとは、画像の「理解(認識・説明)」と「生成(作成)」という性質の異なる2つのタスクを、単一の自己回帰型モデルで統合的にこなす視覚モデルのこと。
マルチ参照生成とは、複数の参照画像を同時入力し、人物・スタイル・構図の一貫性を保ったまま新しい画像を生成する手法のこと。
レイヤー分離生成とは、画像を背景・被写体・文字などの要素ごとに独立したレイヤーとして生成し、後から個別に編集できるようにする画像生成手法のこと。
プロンプト忠実度とは、 画像・動画生成 AI が入力プロンプトの指示内容をどれだけ正確に画像へ反映できるかを示す指標のこと。
Rectified Flow(整流フロー)とは、ノイズからデータへの生成過程を直線的な経路として学習し、少ないステップで高品質な画像・動画生成を可能にする拡散モデルの派生手法のこと。
フローマッチングとは、ノイズと実データを結ぶ経路を直接学習することで画像・動画を生成する拡散モデルの発展技術のこと。
T2I-Adapterとは、拡散モデルによる画像生成AIに対し、線画・姿勢・深度などの構造情報を軽量なアダプタネットワークで追加学習させ、生成結果を細かく制御する技術のこと。
Canny制御とは、画像から輪郭線(エッジ)を検出し、その線画情報をガイドに生成AIの構図やポーズを固定する制御技術のこと。
GAN(敵対的生成ネットワーク)とは、生成器と識別器という2つのニューラルネットワークを競わせながら学習させ、本物と見分けがつかないデータを作り出す機械学習の手法のこと。
リアルタイム画像生成とは、テキストや操作入力に応じて数十〜数百ミリ秒単位で画像を逐次生成し、描画やプレビューをその場で更新する技術のこと。
画像バリエーション生成とは、元となる1枚の画像から構図や画風を保ちながら複数の異なるパターンを自動生成する機能のこと。
ポーズ制御(OpenPose Control)とは、画像生成AIで人物の骨格・関節位置を指定し、狙った姿勢の人物画像を生成させる制御技術のこと。
バーチャルステージングとは、空室の物件写真にAIで家具や装飾を合成し、生活感のあるインテリア画像を作る手法のこと。
AIロゴ生成とは、ブランド名やイメージを入力するだけで、画像生成AIが複数パターンのロゴ案を自動で作り出す技術のこと。
Chromaとは、Flux.1系アーキテクチャを基盤に公開されたオープンウェイトの画像生成AIモデルのこと。
顔復元(Face Restoration)とは、劣化・低解像度・ブレなどで乱れた顔写真をAIが特徴を推定して自然な状態に復元する画像処理技術のこと。
マルチビュー生成とは、1枚または少数の画像から同一の被写体やシーンを複数の視点(アングル)で一貫性を保ちながら生成するAI技術のこと。
タイル拡散とは、高解像度画像を生成する際にキャンバスを複数の小領域(タイル)に分割し、各タイルを個別に拡散処理してつなぎ合わせる画像生成AIの手法のこと。
画像モーフィングとは、ある画像から別の画像へ滑らかに変形しながら遷移させる画像生成・編集技術のこと。
PixArtとは、Diffusion Transformer構造を採用し高速・低コストな学習を実現する画像生成AIモデルのことである。
Nano Banana Proとは、Google DeepMindが開発したGemini基盤の高精度画像生成・編集AIモデルのこと。
AIステッカー生成とは、テキストプロンプトや参照画像をもとに、LINEスタンプやチャット用のステッカー画像をAIが自動生成する技術のこと。
AI建築パース生成とは、建物の設計図や3Dモデルから、AIが写真のようなリアルな完成予想図(パース)を自動生成する技術のこと。
対話型画像編集とは、チャット形式で指示を出しながら画像を段階的に修正していく生成AIの画像編集手法のこと。
AIフィギュア化生成とは、実写や2Dイラストの人物・キャラクター画像を、生成AIでフィギュア風の立体的なパッケージ写真調ビジュアルに変換する技術のこと。
Automatic1111とは、Stable Diffusionをブラウザ上のGUIで操作できるオープンソースの画像生成WebUIのこと。拡張機能導入で機能を柔軟に拡張できる。
スコア蒸留サンプリング(SDS)とは、学習済みの2D拡散モデルが出力するノイズ予測を勾配として使い、3Dモデルや画像のパラメータを直接最適化する生成手法のこと。
潜在空間補間とは、生成AIの潜在空間上で2点間を滑らかに繋ぐことで、中間的な画像や動画フレームを生成する手法のこと。
AIアイコン生成とは、画像生成AIを使ってSNSやアプリ用のプロフィールアイコン・ロゴ素材を自動作成する手法のこと。
AIぬりえ生成とは、画像生成AIを使って子ども向け・大人向けの線画イラスト(塗り絵用テンプレート)を自動で作り出す手法のこと。
ADetailerとは、AI画像生成で崩れやすい顔や手を自動検出し、その部分だけ高解像度で描き直して補正するStable Diffusion拡張機能のこと。
ベクター画像生成とは、AIが拡大縮小しても輪郭が崩れないSVG形式のパスデータとして、ロゴやアイコン、イラストを生成する技術のこと。
インフォグラフィック生成とは、テキストやデータをAIが解析し、図表・アイコン・レイアウトを組み合わせた視覚資料に自動変換する技術のこと。
トリガーワードとは、LoRA(追加学習モデル)が学習した人物・画風・構図などの特徴を画像生成時に呼び出すため、プロンプトに含める特定の単語やフレーズのことである。
アスペクト比指定とは、AIで画像や動画を生成する際に、幅と高さの比率(16:9や1:1など)をあらかじめ指定するパラメータ設定のことである。
変換強度とは、img2img生成で元画像へどれだけノイズを加えて再構成するかを0〜1の数値で指定するパラメータのこと。
サンプリングステップ数とは、拡散モデルがノイズ画像から最終画像を生成するまでに繰り返すノイズ除去の反復回数のこと。
チェックポイントモデルとは、Stable Diffusionなど画像生成AIが学習した重みパラメータ一式を保存したファイルのことで、生成される画風や画質の土台となるもののこと。
透過画像生成とは、AIが被写体を背景から自動分離し、アルファチャンネル付きPNGなど透明背景の画像を出力する技術のこと。
SAMとは、画像内の任意の物体をクリックやボックス指定だけで自動的に切り出せる、Meta AI開発の汎用セグメンテーションモデルのこと。
画像キャプション生成とは、画像の内容をAIが解析し、その説明文を自然な文章として自動で作り出す技術のこと。
プロンプトエンハンサーとは、ユーザーが入力した短い指示文をAIが自動で語彙補完・具体化し、画像生成AIの出力品質を底上げする支援機能のこと。
AIサムネイル生成とは、動画や記事のクリック率を左右するサムネイル画像を、生成AIモデルが構図・配色・テキスト配置まで自動で作成する技術のこと。
スタイルリファレンスとは、生成したい画像の代わりに参照画像のURLをプロンプトに加え、その画風だけを新しい画像生成に継承させるMidjourneyなどの機能のこと。
顔匿名化とは、画像や動画に写った人物の顔を検出し、ぼかし・モザイクやAI生成の別人格顔に置き換えてプライバシーを保護する技術のこと。
Hires.fixとは、画像生成AIで低解像度の画像をまず生成し、その後アップスケールして高解像度で再度描画し直す二段階の生成処理のこと。
タグ形式プロンプトとは、単語やフレーズをカンマ区切りで並べて画像生成AIに特徴・スタイルを指示する記法のこと。
Civitai とは、 Stable Diffusion 系の画像生成モデルや LoRA を 無料でアップロード・共有・ダウンロードできる モデル共有コミュニティサイトのこと。
生成パラメータ埋め込みとは、AI画像生成時に使ったプロンプトやモデル名、seed値などの設定情報を画像ファイル自体に記録する仕組みのこと。
解剖学的破綻とは、AI画像生成で指の本数・関節の位置・手や腕のつながりなどが人体構造として不自然に破綻してしまう現象のことである。
リファイナーとは、画像生成AIが出力した粗い画像を追加処理し、ディテールや画質を高める仕上げ用モデルのこと。
CLIP Skipとは、Stable Diffusionなど画像生成AIでCLIPテキストエンコーダーの最終層を意図的に読み飛ばす設定のことである。
イメージ・トゥ・3Dとは、写真や画像1枚(または複数枚)から立体的な3Dモデルを自動生成するAI技術のこと。EC商材の360度化やゲーム制作の工数削減に使われる。
Diffusersとは、Hugging Faceが提供する、Stable Diffusionなど拡散モデルの学習・推論を統一APIで扱えるPythonライブラリのことである。
AIモックアップ生成とは、テキスト指示や参考画像から、Webサイトやアプリ画面、製品パッケージなどの完成イメージ(モックアップ)をAIが自動生成する技術のこと。
オブジェクト除去(Object Removal)とは、写真や画像に写り込んだ不要な人物・物体・文字などをAIが検出し、周囲の情報から自然に補完して消し去る画像編集機能のこと。
Nightshade / Glazeとは、イラストをAI学習データとして無断利用されないよう、画像に人間の目にはほぼ見えない微細なノイズを加えて学習を妨害する保護ツールのこと。
ブランドキットとは、AI画像生成において配色・フォント・キャラクター・トンマナなどのスタイル要素を事前登録し、量産する画像やクリエイティブの見た目を統一する仕組みのこと。
Whiskとは、被写体・シーン・スタイルの画像を組み合わせ、Geminiと画像生成AIで新しい画像を作れる、Googleの画像リミックスツールのこと。
AIレタッチとは、AIモデルが人物写真の肌質や輪郭、光の当たり方などを自動で補正する画像編集手法のこと。
U-Netとは、画像を段階的に圧縮してから元の解像度へ復元する、左右対称の構造を持つニューラルネットワークのこと。拡散モデルのノイズ除去処理の中核を担う。
Prompt-to-Promptとは、拡散モデルのクロスアテンションマップを操作し、プロンプトの一部を書き換えるだけで元画像の構図を保ったまま特定要素を編集できる画像編集手法のこと。
ノイズスケジュールとは、拡散モデルが画像を生成する各ステップで、どれだけノイズを加える・取り除くかを制御する数値の変化パターンのこと。
AIバナー広告生成とは、生成AIモデルを使い、広告用バナー画像のデザイン案を自動で複数パターン量産する手法のこと。
DDIMインバージョンとは、拡散モデルの逆過程をたどって実在する画像に対応する潜在変数(初期ノイズ)を復元する手法のこと。
AIファッションデザイン生成とは、テキストや参照画像から衣服のデザイン案や着用イメージを画像生成AIで作り出す手法のこと。
AI絵本生成とは、生成AIで物語の文章とイラストを組み合わせ、子供向け絵本を自動または半自動で制作する手法のこと。
LAIONとは、Web上から収集した画像とテキストのペアを数十億件規模で集めたオープンな学習用データセット、またはそれを公開する非営利団体のこと。
美的スコアとは、AIが生成した画像の構図・色彩・ディテールなどを学習済みモデルが自動採点し、数値で表す評価指標のこと。
画像生成セーフティフィルタとは、AI画像生成サービスが暴力的表現・性的表現・著作権侵害などの不適切な出力を自動検知してブロックする仕組みのこと。
キャラクター参照 (--cref) とは、Midjourneyで同一キャラクターの外見や特徴を複数の生成画像間で一致させるために、参照画像を指定するパラメータのこと。
AIフォント生成とは、機械学習モデルが文字の形状パターンを学習し、指定したスタイルの書体やロゴ用文字を自動生成する技術のこと。
解像度バケット(Bucketing)とは、画像生成AIの学習時に、元画像を縦横比の近い解像度グループに分類し、バッチごとに近い解像度でまとめて処理する手法のこと。
NovelAIとは、アニメ・イラスト調の画像生成に特化したサブスクリプション型AIサービスのこと。独自学習の拡散モデルとテキスト生成補助機能も提供する。
生成塗りつぶし(Generative Fill)とは、画像の一部を選択範囲として指定し、AIがその周囲の文脈に合わせて自然な新しい要素を生成・合成する画像編集機能のこと。
ノイズオフセットとは、拡散モデルの学習時にノイズへ一定のオフセットを加算し、真っ黒や真っ白に近い極端な明暗の画像を生成しやすくする手法のこと。
正則化画像とは、DreamBoothやLoRAなどの追加学習で過学習を防ぐために使う、対象クラスの一般的な生成画像のこと。
カラーパレット制御とは、AI画像生成で出力画像の配色をプロンプトやパラメータによって指定・調整する手法のこと。ブランドカラーの統一や狙った色調の再現に使われる。
AIチラシ・DTP生成とは、生成AIを使って店舗や商品のチラシ・ポスターなど印刷物のレイアウトと画像を自動で作成する手法のこと。
Kohya_ssとは、Stable Diffusionモデルの追加学習(LoRA等)を行うためのオープンソースなGUI/スクリプト群のことである。
LyCORISとは、画像生成AIのLoRAを拡張し、学習可能パラメータの構造を柔軟に変えられるようにした追加学習手法群の総称のこと。
Real-ESRGANとは、低解像度の画像をAIで拡大し、ノイズやブロックノイズを抑えながら自然な高解像度画像に変換する超解像モデルのこと。
AIパッケージデザイン生成とは、生成AIで商品パッケージのラベルや箱・缶のデザイン案を自動生成する技術のこと。立体形状や陳列時の見え方を踏まえた複数案を短時間で比較検討できる。
AI間取り図生成とは、テキストや条件指定をもとに生成AIが建物の間取り図やレイアウト案を自動生成する技術のこと。
テキスト・トゥ・CADとは、自然言語による指示文からCAD(コンピュータ支援設計)用の設計データを自動生成する生成AI技術のこと。
世代劣化とは、AI画像を生成・編集を繰り返すたびに画質やディテールが少しずつ失われ、元の意図から乖離していく現象のこと。
LCM-LoRAとは、画像生成AIの推論ステップ数を4〜8程度まで削減し、数秒での高速生成を可能にする軽量LoRAアダプターのこと。
レイアウト指定生成とは、画像内の各要素の位置やサイズをバウンディングボックスなどで事前指定してから生成する画像生成手法のこと。
ゲームアセット生成とは、AI画像生成モデルを使ってキャラクター・背景・アイテムなどのゲーム内素材を自動生成する手法のこと。
スタイライズ強度 (--stylize) とは、 画像生成 AI が プロンプトの内容に忠実な出力と AI 独自の芸術的な装飾を どの程度混ぜるかを 調整するパラメータのこと。
動画生成 (144)
カテゴリ単独で見る →Sora / Runway / Klingなど動画AI
OpenAI の動画生成 AI。 ChatGPT Pro で利用可能、 最大 20 秒の高品質動画を生成。
プロ向け AI 動画編集・生成スイート。 Gen-3 / Gen-4 で 映画品質の動画を生成。
VeoとはGoogle DeepMindが開発した動画生成AIモデルのこと。テキストプロンプトや静止画から高精細な動画を生成でき、物理的整合性と映像の時間的一貫性においてSoraと並ぶ業界最高水準を誇る。
Kling(可灵)とは、中国の快手(Kuaishou)が開発したAI動画生成モデルのこと。テキストや画像から最大2分・1080pの高品質動画を生成でき、SoraやRunwayと並ぶ有力な動画生成AIとして世界的に注目されている。
PikaとはテキストプロンプトやAI画像を入力するだけで3〜10秒の高品質な短尺動画クリップを自動生成できるAI動画生成プラットフォームのこと。
Luma Dream Machineとは、Luma AIが提供するテキストや画像から高品質な動画クリップを自動生成できるAIビデオ生成ツールのこと。物理的にリアルな映像と滑らかなカメラワークを特徴とする。
テキスト・トゥ・ビデオとはテキストプロンプトを入力するだけで動画を自動生成するAI技術のこと。文章から映像・音声・ナレーションまでを一括生成でき、動画制作を民主化する。
イメージ・トゥ・ビデオとは、静止画像1枚を入力としてAIが連続フレームを自動生成し、動きのある動画クリップへ変換する生成AI技術のこと。
AIアバターとは、人物の顔・声・動作をAIが生成・合成し、実写さながらの仮想キャラクターや分身を映像として出力する技術のこと。
リップシンクとは、動画内の人物の口の動きを音声や台詞と自動で同期させるAI技術のこと。
Hailuo(海螺AI)とは、中国のAIスタートアップMiniMaxが開発した、テキストや参照画像から高品質な動画を自動生成できるAI動画生成ツールのこと。
キーフレームとは、動画の特定時点における画像・ポーズ・スタイルを固定することで、AI動画生成の動きや構図を制御するための基準フレームのこと。
カメラコントロールとは、AI動画生成においてパン・ティルト・ズーム・ドリーなどのカメラワークをテキストプロンプトやGUIパラメータで指定・制御する機能のこと。
フレーム補間とは、映像の既存フレーム間にAIが中間フレームを自動生成し、滑らかな動きや高フレームレートを実現する技術のこと。
動画延長とは、生成AIを使って既存の動画クリップの末尾を自然につなぎ、より長い映像を自動生成する技術のこと。
Wan (通義万相) とはアリババ(阿里巴巴)が開発したオープンソースの動画生成 AI モデルのこと。テキストや画像から高品質な短尺動画を生成できる。
モーションブラシとは、静止画の特定領域をブラシで塗ることで、その部分だけをAIが自動的にアニメーション化できる動画生成機能のこと。
テンポラル一貫性とは、AI動画生成において隣接するフレーム間で被写体・背景・照明などの視覚要素が矛盾なく保たれる性質のこと。
音声同時生成動画とは、映像と音声(SE・BGM・ナレーション)をAIが一括して同時に生成する動画制作技術のこと。
動画アップスケールとは、低解像度や古い動画をAIが解析し、ディテールを補完しながら高解像度・高フレームレートに変換する映像処理技術のこと。
マルチショット生成とは、1回の生成プロセスで複数のカメラショット(場面転換)を含む動画を、キャラクターや背景の一貫性を保ちながら連続して出力する技術のこと。
SeedanceとはByteDance(TikTok親会社)が開発した、テキストや画像から高品質な動画を生成するAIモデルのこと。
HeyGenとはテキストや台本を入力するだけでAIアバターが登場する動画や多言語吹き替え動画を自動生成できる、企業・クリエイター向け動画制作SaaSのこと。
動画インペインティングとは、動画フレーム内の指定領域を前後フレームの情報をもとに時系列の整合性を保ちながら自動補完・修復するAI技術のこと。不要オブジェクト除去や映像修復に広く使われる。
動画スタイル変換(Video Restyle)とは、既存の動画のコンテンツ構造を保ちながら映像の見た目・画風・質感だけを別のスタイルに変換するAI技術のこと。
トーキングヘッド動画とは、人物の顔・上半身を映したまま口が動いてしゃべっているように見せるAI生成動画のこと。
絵コンテから動画(Storyboard-to-Video)とは、カット割りやカメラワークを描いた絵コンテをAIが解析し、連続した動画クリップへ自動変換する映像制作手法のこと。
Higgsfield(ヒッグスフィールド)とは、人物の自然な動作表現とシネマティックな映像品質に特化したAI動画生成サービスのこと。
モーション転送とは、ある動画や人物の動き情報を骨格推定で抽出し、別のキャラクターや映像に適用して同じ動きを再現するAI技術のこと。
長尺動画生成とは、AIを使って数分〜数十分規模の動画コンテンツを自動生成する技術のこと。脚本・ナレーション・映像合成を一気通貫で行い、従来の制作コストを大幅に削減できる。
リアルタイム動画生成とは、テキストや画像の入力に対してほぼ遅延なく動画コンテンツを生成するAI技術のこと。
DiT(拡散トランスフォーマー)とは、画像・動画生成モデルの内部構造でU-Netの代わりにTransformerを用いる拡散モデルのアーキテクチャのこと。
物理整合性とは、AI生成動画や3Dモデルにおいて重力・慣性・衝突などの物理法則に沿った自然な動きが再現されているかを示す指標のこと。
開始終了フレーム指定とは、動画生成AIに始点と終点の2枚の静止画を与え、その間の動きを自動補間させる手法のこと。
動画トークナイザとは、動画を時空間パッチや離散的なトークン列に変換し、生成AIモデルが扱える形式にする技術のこと。
AIロトスコープとは、動画の各フレームからAIが被写体を自動抽出し、線画やアニメ風の表現に変換する技術のこと。
Google Flow(フロー)とは、Googleの動画生成AI「Veo」とImagen、Geminiを組み合わせ、キャラクターやシーンの一貫性を保ちながら短編映像を作れるAI動画制作ツールのこと。
LTX Videoとは、Lightricksが開発したオープンソースの高速動画生成AIモデルのことで、軽量設計により一般的なGPUでも高速に動画を書き出せる点が特徴。
Mochiとは、AIスタートアップGenmoが開発した、テキストから動画を生成するオープンソース系の動画生成AIモデルのこと。
カメオ出演とは、本人が撮影した顔・声の参照データをAI動画生成サービスに登録し、生成動画内に本人そっくりの映像を差し込める機能のことである。
プレイアブル世界モデル(Genie型)とは、1枚の画像や短いプロンプトから、キー操作などで探索できる仮想空間をリアルタイム生成するAI技術のこと。
AI動画編集とは、素材選定・カット割り・字幕生成・音声調整などの動画編集工程をAIが自動化する制作手法のこと。
動画リライティングとは、撮影済み動画の照明・光源をAIで解析し直し、時間帯や光の向き・色温度を後から自在に変更する技術のこと。
Grok Imagine とは、 xAI が Grok アプリに統合した動画生成 AI 機能のことで、 テキストや 1 枚の静止画から 数秒の短尺動画を自動生成するツールを指す。
動画キャラクター一貫性とは、AI生成動画において同一キャラクターの顔・体型・服装などの見た目を、複数のシーンやカットをまたいで保持し続ける技術のこと。
HunyuanVideo(混元動画)とは、Tencentが2024年12月に公開したオープンソースの動画生成AIモデルのこと。
CogVideoXとは、清華大学系のZhipu AIが開発したオープンソースの動画生成AIモデルのことで、商用APIに頼らず自前でホスティングできる点が特徴。
Vidu とは 中国 Shengshu 社が開発する AI 動画生成サービスのこと。 テキストや画像から数秒〜十数秒の動画を生成し、 キャラクターの一貫性維持に強みを持つ。
PixVerse(ピックスバース)とは、テキストや静止画から数秒〜数十秒の短尺動画を自動生成できるAI動画生成サービスのこと。
動画から動画(Video-to-Video)とは、入力した動画の動きや構図を保ったまま、スタイルや画質、背景などをAIで別の映像に変換する動画生成技術のこと。
FramePackとは、動画生成AIが長尺の動画を作る際に、過去フレームを圧縮して一定サイズの入力に収め、メモリを節約しながらフレーム数を延ばす手法のこと。
AI VTuberとは、音声合成・モーション生成・対話AIを組み合わせ、AIが自律的にキャラクターとして配信や動画を演じる仕組みのこと。
AIモーションキャプチャとは、マーカーや専用スーツを使わず通常のカメラ映像から人体の骨格・動きをAIが解析し、3Dデータとして抽出する技術のこと。
動画要約とは、AIが動画の音声・字幕・映像内容を解析し、要点を短いテキストや短尺動画にまとめる技術のこと。
自動字幕生成とは、AIが動画や音声から発話内容を認識し、字幕(キャプション)をタイムコードと同期させて自動的に生成する技術のこと。
縦型ショート動画生成とは、TikTokやReelsなどスマホ視聴に最適化した9:16の短尺動画をAIが自動生成する技術のこと。
デジタルヒューマンとは、AIで人間そっくりの外見・表情・声を再現し、映像や対話で活用できるバーチャルキャラクターのこと。
動画背景差し替えとは、AIが動画内の被写体を自動検出し、背景だけを別の映像やCG空間に置き換える技術のこと。
バーチャルプロダクションとは、LEDウォール映像とゲームエンジンのリアルタイムCGを組み合わせ、撮影現場で背景合成まで完結させる映像制作手法のこと。
動画から3Dとは、単眼または複数視点の動画映像からAIが被写体や空間の奥行きを推定し、立体的な3Dモデルを自動生成する技術のこと。
シームレスループ動画とは、動画クリップの終端と始端をAIが違和感なく接続し、継ぎ目を感じさせず無限再生できるように生成した動画のことである。
MAGI-1とは、中国のSand AIが開発しオープンソース公開した自己回帰型の動画生成AIモデルのこと。
SkyReelsとは、静止画1枚と簡単な指示から、まばたきや表情変化まで含む自然な人物動画を生成できるAI動画生成モデルのこと。
動画フェイススワップとは、動画内の人物の顔を別人の顔に置き換えて自然に合成するAI技術のことである。
リアルタイムアバターとは、AIが人物の表情や口の動きを即座に生成し、配信や対話にその場で反映させる技術のこと。
参照動画生成とは、既存の画像や動画をリファレンスとしてAIに与え、その構図・動き・スタイルを引き継いだ新しい動画を生成する技術のこと。
動画リフレームとは、元の動画から被写体を検出し、縦横比の異なる画面へ自動で構図を再構成する技術のこと。
Act-One(演技キャプチャ生成)とは、俳優が演じた表情や視線の動きを一本の参照動画から解析し、生成AIキャラクターの演技としてそのまま転写する動画生成機能のこと。
オプティカルフローとは、動画の連続フレーム間で画素がどう移動したかを推定する技術のこと。動画生成AIの動き制御・補間・手ブレ補正の基盤技術として使われる。
モーションLoRAとは、動画生成AIの基盤モデルへの軽量な追加学習によって特定のカメラワークや被写体の動きを再現できるようにする技術のことである。
動画セグメンテーションとは、動画の各フレームに写る人物・物体・背景をピクセル単位で識別し、領域ごとに分割する画像認識技術のことである。
ニューラルレンダリングとは、深層学習モデルで3D形状や光の反射・質感を学習し、写実的な画像や映像を生成するレンダリング手法のことである。
AI VFXとは、動画編集における合成・エフェクト生成をAIモデルで自動化し、ロトスコープやトラッキング、色調補正などの映像加工を効率化する技術のこと。
AIショートドラマとは、生成AIで脚本・音声・映像を制作し、数分程度で完結する短編・縦型のドラマ形式コンテンツのこと。
AI広告動画生成とは、生成AIを使って商品やサービスの訴求動画を台本・映像・音声込みで自動または半自動制作する広告制作手法のこと。
AIアニメーション生成とは、テキストや静止画などの入力をもとに、生成AIがキャラクターの動きや背景のある映像を自動で作り出す技術のこと。
AI自動クリップ生成(Auto Clipping)とは、長尺動画からAIが盛り上がり部分を自動検出し、SNS向けの短尺クリップとして切り出す技術のこと。
AIモーショングラフィックスとは、生成AIを用いて図形・テキスト・ロゴなどにアニメーションを自動で付与し、動画表現を作る手法のこと。
AI映画制作とは、脚本作成・映像生成・音声合成などの工程にAIツールを組み込み、少人数かつ低予算で映画やドラマ形式の作品を制作する手法のこと。
モーションプロンプトとは、動画生成AIに対して被写体やカメラの動かし方を具体的に指示するテキストのこと。
ビジュアル吹き替えとは、話者の口の動き・表情をAIで翻訳後の音声に同期させ、違和感の少ない多言語吹き替え動画を作る技術のこと。
パララックス動画(2.5D生成)とは、1枚の静止画から奥行き情報を推定し、前景と背景を分離してカメラが動いているように見せる動画生成手法のこと。
動画アウトペインティングとは、既存動画のフレーム外側をAIが生成して補い、画角やアスペクト比を拡張する技術のこと。
Marey(マレー)とは、Moonvalleyが開発した、権利処理済みの映像のみで学習した3D対応のAI動画生成モデルのこと。
ボリュメトリックビデオとは、被写体を四方から多数のカメラで撮影し、点群やメッシュとして3D化することで、視聴者が任意の視点から見られる動画形式のことである。
無限ズーム動画とは、AIで生成した画像を次々とつなぎ合わせ、ズームし続けても新しい情景が無限に現れるように見せる動画表現のこと。
テキスト・トゥ・モーション(Text-to-Motion)とは、テキストで記述した動作指示から人物やキャラクターの動きそのものを生成する動画・モーション生成技術のこと。
AIミュージックビデオ生成とは、生成AIを用いて楽曲のリズムや歌詞の世界観に合わせた映像・アニメーションを自動で作り出す手法のこと。
AnimateDiffとは、Stable Diffusionなどの画像生成モデルにモーションモジュールを追加学習させ、静止画のまま短尺アニメーション動画を生成できるようにするオープンソース手法のこと。
Stable Video Diffusion(SVD)とは、Stability AIが公開した画像から短尺動画を生成するオープンソース拡散モデルのこと。
AIスローモーション生成とは、AIがフレーム補間によって中間コマを新規に推論生成し、通常速度の映像を高フレームレート化してなめらかな低速再生映像に変換する動画技術のこと。
AI手ぶれ補正とは、動画内のカメラの揺れやブレをAIが解析し、フレーム単位で位置合わせして滑らかな映像に自動修正する技術のことである。
AIカラーグレーディングとは、AIが映像内の色調・明るさ・コントラストを解析し、シーンごとの雰囲気やブランドトーンに合わせて配色を自動調整する技術のこと。
動画理解とは、AIが動画内のシーン展開や物体の動き、音声、時系列の変化を解析し、映像の内容や文脈を認識・要約する技術のこと。
オーディオ駆動アニメーションとは、音声波形から抽出した音素やピッチ、音量などの特徴をもとに、キャラクターの口の動きや表情、身振りを自動生成する技術のこと。
AI解説動画生成(Explainer Video)とは、台本やスライドからナレーション・字幕・映像を自動合成し、製品やサービスの仕組みを短尺動画で伝える生成AI技術のこと。
シーン検出とは、動画内のカットの切り替わりや場面転換が起きたタイミングを解析してAIが自動で検出する技術のこと。
モーション強度とは、AI動画生成モデルにおいて生成映像内の動きやカメラワークの量・激しさを数値やスライダーで指定する制御パラメータのこと。
被写体トラッキングとは、 動画内の人物や物体をフレームをまたいで自動追跡し、 位置・輪郭・動きを一貫させる技術のこと。
中割り生成とは、アニメーション制作における原画と原画の間の中間フレーム(中割り)を、AIモデルが自動で補完・生成する技術のこと。
Bロール生成とは、インタビューや解説動画の合間に挿入する補足映像(Bロール)をAIが自動生成する技術のこと。
OmniHumanとは、1枚の人物画像と音声や動きの参照データを組み合わせ、口の同期や身振りまで含む自然な全身動画を生成するAI技術のこと。
フレームレート制御とは、動画生成AIが出力する1秒あたりのコマ数(fps)を指定し、動きの滑らかさや生成時間・コストを調整する機能のこと。
AIプレビズとは、生成AIで映像制作前のカメラワークや画面構成を仮組みし、絵コンテ代わりに使う手法のこと。
AIライブ配信とは、AI生成の音声・映像やバーチャルアバターを使い、人手の実況や編集を介さずリアルタイムで配信を行う手法のこと。
JSON動画プロンプトとは、シーン構成やカメラワーク、被写体の動きなどをJSON形式で構造化して記述する動画生成AI向けのプロンプト手法のこと。
AI字幕翻訳とは、動画内の音声を音声認識で文字起こしし、多言語の字幕へ自動翻訳・生成する技術のこと。
NeRFとは、複数枚の2D画像から3D空間内の色と密度をニューラルネットワークで学習し、任意の視点から写真のような画像を再構成する技術のこと。
4D生成とは、時間経過に伴う形状や動きの変化を含む3Dシーンを、テキストや画像から自動生成する技術のこと。
不気味の谷とは、 AIが生成した人間の顔や動作が 本物に近づくほど 逆に強い違和感や嫌悪感を覚える現象のこと。
テキストベース動画編集とは、動画の音声をテキスト化した台本を編集する操作に連動して映像も自動でカット・並べ替えされる動画編集手法のこと。
フリッカーとは、AI生成動画のフレーム間で明るさ・色調・質感が微妙にずれて生じるちらつきやノイズ現象のことである。
AIストック素材とは、生成AIでテキストや画像から作られる、著作権処理済みの動画・画像素材のこと。
映像修復とは、AIを用いて劣化・ノイズ・欠損のある古い映像や低画質の動画をアップスケーリングし高画質に復元する技術のこと。
クリップ長指定とは、動画生成AIで出力する映像の長さ(尺)を秒数やフレーム数などで細かく指定できる機能のこと。
AI予告編生成とは、動画コンテンツの本編素材からAIが見せ場を自動抽出し、テンポの良い予告編(トレーラー)を組み立てる技術のこと。
動画メタデータ自動付与とは、AIが動画内容を解析しタグ・キーワード・シーン情報などのメタデータを自動生成して検索性や管理効率を高める技術のこと。
AI手話アバターとは、音声やテキストをリアルタイムで手話表現に変換し、CGキャラクターが動きで伝える技術のこと。
パーソナライズ動画生成とは、視聴者ごとの氏名・属性・行動データをもとに、AIが映像や音声を自動で個別に出し分けて生成する動画のことである。
ニューラル動画コーデックとは、ニューラルネットワークで動画データの圧縮と復元を行い、従来コーデックより高圧縮率を狙う技術のこと。
映像解析AIとは、防犯カメラや工場ラインの映像をAIがリアルタイムで解析し、人物の動き・異常行動・物体の有無などを自動検知する技術のこと。
時刻特定(Temporal Grounding)とは、動画生成AIがプロンプト中の時間指示を実際の映像フレームのタイムコードと正確に対応づける技術のこと。
空間ビデオとは、通常の平面動画に奥行き情報を加え、Apple Vision ProなどのXRデバイスで立体的に視聴できる動画形式のこと。
自己回帰動画生成とは、直前までに生成したフレームを条件として次のフレームを逐次予測し、動画を先頭から順に生成していく手法のこと。
表情転送とは、ある人物の表情の動き(眉・目・口の動き)を別のキャラクターやアバターの顔にリアルタイムで反映させる技術のこと。
マルチアングル生成とは、1つのシーンをAIが複数のカメラ視点から一貫性を保って同時に生成する動画生成技術のこと。
音声解説生成とは、映像の場面転換や登場人物の動作・表情など視覚情報をナレーション音声で説明し、目の不自由な視聴者や画面を見ない環境でも内容を理解できるようにするAI技術のこと。
AI動画SNSとは、OpenAIのSora AppやMetaのVibesのように、AI生成動画だけで構成される専用フィードで視聴・リミックス・共有を行うSNS形態のこと。
トランジション生成とは、AI動画生成において複数のクリップ間をカット割りではなく滑らかな変化でつなぐ処理のこと。
チャプター自動生成とは、動画の音声・字幕・映像をAIが解析し、話題の切り替わりごとにタイムスタンプ付きの章立てを自動で作成する技術のこと。
肖像フィルタとは、AI動画生成サービスが実在人物の顔や声を本人の同意なく生成・悪用されないよう検知し、生成を制限する技術的な仕組みのこと。
空間知能とは、AIが2D画像や映像から物体の奥行き・配置・物理的な関係性を3Dとして理解し、動きや変化を予測する能力のこと。
シネマグラフとは、静止画の大部分を静止させたまま一部分だけをループ動画として動かし、写真と映像の中間のような視覚効果を生み出す表現手法のことである。
資料から動画生成(Doc-to-Video)とは、PDFやスライド、ドキュメントをAIが自動で解析し、ナレーション付きの動画へ変換する技術のこと。
動画内テキスト生成とは、AI動画生成モデルが字幕やロゴ、看板の文字などを画面内に直接描画する技術のこと。
プロンプトトラベルとは、動画生成AIで時間軸に沿って複数のプロンプトを切り替え、映像の内容を滑らかに変化・遷移させる制御手法のこと。
自動リギングとは、AIが3Dキャラクターモデルの骨格(ボーン)や関節の可動域を自動生成し、モーションを付けられる状態に整える技術のこと。
時空間アテンションとは、動画生成AIが各フレーム内の空間的な特徴とフレーム間の時間的な変化を同時に捉える注意機構のこと。
動画学習データセットとは、動画生成AIモデルの学習に使う大量の動画クリップとテキストキャプションのペア集合のこと。
動画バーチャル試着とは、着用者の写真や動画にAIで衣服を合成し、試着時の動きや生地の揺れまで動画で確認できる技術のこと。
AI映画祭とは、生成AIで制作された短編映画・アニメーション作品を上映し審査するコンペティション形式のイベントのこと。
Runway Alephとは、動画クリップに自然言語の指示を与えるだけでオブジェクトの追加・削除やカメラアングル変更などができるRunwayのインコンテキスト動画編集AIのこと。
モーションコミック生成とは、漫画やイラストの静止画にAIでパン・ズーム・口パクなどの動きを加え、短尺の動画コンテンツに変換する技術のこと。
Marbleとは、テキストや画像、動画をもとに探索可能な3D空間をAIが自動生成するWorld Labs製のワールドモデルのこと。
音声・音楽 (137)
カテゴリ単独で見る →Suno / ElevenLabs / Whisperなどの音声AI
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
リアルタイム音声とは、AIが音声入力をほぼ遅延ゼロで認識・生成し、人間同士の会話に近い応答速度を実現する技術のこと。
Udio (ユーディオ) とはテキストプロンプトから楽曲・歌詞・ボーカルを一括生成できるAI音楽生成サービスのこと。
音楽生成とはAIがテキストプロンプトやジャンル指定などの入力をもとに、メロディ・コード・リズムを含む楽曲を自動で生成する技術のこと。
話者分離とは、複数人の会話音声から「誰がいつ話したか」を自動的に識別・分類する機械学習技術のこと。文字起こしと組み合わせて話者ラベル付き議事録の自動生成などに使われる。
効果音生成とは、AIがテキストや映像・音声の指示をもとに、爆発音・環境音・UI音などの効果音を自動で生成する技術のこと。
音声変換とは、ある人物の声質・音色を別の人物や任意のスタイルに変換するAI技術のこと。話者の言語内容を保持しながら声のキャラクターだけを変える。
ステム分離とは、AIが混合された音源ファイルからボーカル・ドラム・ベースなど各パートを個別トラックに分離して抽出する技術のこと。
SSMLとはテキスト読み上げ(TTS)エンジンに対して発音・速度・ポーズ・抑揚などを細かく制御するためのXMLベースのマークアップ言語のこと。
AIポッドキャスト生成とは、テキスト原稿や箇条書きメモをもとにAIが音声合成・編集・BGM付与までを自動で行い、ポッドキャスト番組を丸ごと生成する技術のこと。
歌声合成とは、楽譜・歌詞・音程情報をもとにAIが人間の歌声を自動生成する技術のこと。VOCALOIDに代表される波形接続方式から、深層学習を用いたエンドツーエンド生成へと進化し、2020年代に急速に普及した。
リアルタイム音声翻訳とは、話者の音声をほぼ遅延なく別の言語の音声に変換するAI技術のこと。同時通訳を自動化し、国際商談やインバウンド対応での言語障壁を即座に解消する。
ニューラル音声コーデックとは、ニューラルネットワークを使って音声波形を極限まで圧縮しながら高音質を保つ符号化・復号化技術のこと。TTS・音声クローン・音楽生成モデルの中間表現として急速に普及している。
ボイスエージェントとは、音声を主インターフェースとして会話の理解・推論・実行までを自律的に行うAIエージェントのこと。従来の音声認識やチャットボットと異なり、タスクを自己完結できる点が特徴。
韻律制御とは、AI音声合成においてスピーチのピッチ・リズム・アクセント・抑揚・発話速度を制御し、自然で感情豊かな音声を生成する技術のこと。
全二重音声対話とは、送話と受話を同時並行で処理し、会話の割り込みや相槌をリアルタイムで扱えるAI音声インタフェースのこと。
AI吹き替えとは、映像コンテンツの音声を自動翻訳・合成し、別言語の自然な音声に置き換えるAI技術のこと。
ボイスデザインとは、AIアシスタントの声質・口調・感情表現・話し方のスタイルをブランドや用途に合わせて設計・定義する手法のこと。
音声超解像とは、AIを用いて低サンプリングレートや低ビットレートの音声に失われた高周波成分を推定・補完し、高品質音声へ復元する技術のこと。画像の超解像手法を音響領域に応用したもの。
VADとは音声ストリームの中から人間の発話が含まれる区間だけを自動で切り出す技術のこと。無音・環境ノイズと発話を区別し、音声認識システムの精度向上と計算コスト削減を同時に実現する。
AIノイズ除去とは、機械学習モデルを使って音声・動画から背景雑音やハム音を自動的に取り除く技術のこと。
音声LLMとは、テキスト変換を介さずに音声を直接理解・生成できる大規模言語モデルのこと。感情や声のトーン・リズムも含めてエンドツーエンドで処理する。
感情音声合成(Emotional TTS)とは、テキストを単なる読み上げではなく、喜び・悲しみ・怒りなど人間の感情を模した音声で合成する技術のこと。
MIDI生成とはAIがテキストプロンプトやジャンル指定などの入力から、音符・コード進行・テンポ情報を含むMIDIファイルを自動で出力する技術のこと。
多言語音声合成(Multilingual TTS)とは、複数の言語に対応したテキスト読み上げ技術のこと。自然なイントネーションや発音で、一つのモデルから多言語コンテンツをリアルタイムに音声化できる。
テキスト・トゥ・オーディオとは、文章や指示文から音声・効果音・音楽などの音源データを自動生成するAI技術のこと。
ゼロショット音声合成とは、数秒の音声サンプルのみから話者の声質・抑揚を学習し、未学習のテキストも自然に読み上げる技術のこと。
ストリーミング音声認識(Streaming ASR)とは、音声データを録音完了後ではなく発話と同時に逐次テキスト化する技術のことで、字幕生成や音声アシスタントの即時応答に使われる。
ターン検出(Turn Detection)とは、音声対話AIにおいて話者の発話が終わったかどうかをリアルタイムに判定し、AIが応答を返すべきタイミングを見極める技術のこと。
音声透かしとは、AI生成音声や音楽に検出用の識別情報を人の耳では分からない形で埋め込み、後から機械的にAI生成かどうかを判別できるようにする技術のこと。
Fish Audioとは、数秒の音声サンプルから声をクローンし、多言語のテキスト読み上げ(TTS)を生成できるAI音声合成プラットフォームのこと。
Murekaとは、テキストプロンプトから歌詞・ボーカル・伴奏を備えた楽曲を数十秒で自動生成できるAI音楽生成サービスのこと。
Sesameとは、米Sesame AI社が開発した会話特化型の音声AIモデルで、自然な間合いと感情表現を伴う音声対話を実現する技術のことである。
音声インペインティングとは、音声データの欠損・ノイズ・不要語などの部分を、AIが前後の文脈から自然な波形として生成し補完する技術のこと。
歌声変換とは、 ある人が歌った音源の声質だけを 別の話者・キャラクターの声に置き換える AI 技術のこと。
音声感情認識とは、話し声の周波数・抑揚・話速などから話者の感情状態を推定する技術のこと。
AIマスタリングとは、AIが楽曲の音量バランスやEQ、音圧を解析し、配信基準に沿った最終調整を自動で行う音楽制作工程のこと。
強制アライメントとは、音声データとその書き起こしテキストを単語・音素単位で時間的に対応付け、発話区間ごとの正確なタイムスタンプを自動生成する音声処理技術のこと。
ウェイクワード検出とは、デバイスが常時マイク入力を監視し、「OK Google」「Hey Siri」のような特定の起動語を検知した瞬間だけ音声認識処理を開始する仕組みのこと。
MusicGenとは、テキストや旋律の入力から楽曲を自動生成するMeta発のAI音楽生成モデルのこと。
Kokoroとは、少ないパラメータ数で高品質な音声を生成できる軽量なオープンソースの音声合成(TTS)モデルのこと。
Moshiとは、フランスのAI研究所Kyutaiが開発した、人間の会話のように相手の発話を遮ったり被せたりしながら同時に聞き話せる全二重(フルデュプレックス)音声対話AIモデルのこと。
話者認識とは、音声データから「誰が話しているか」を識別・照合するAI技術のことで、話者の声紋パターンをもとに個人を特定・分類する。
ピッチ補正とは、 歌声や話し声の音程のズレを検出し、 目標のピッチへ自動的に近づける音声処理技術のこと。
音響イベント検出とは、音声ストリームの中からガラス破砕音やサイレン、咳などの特定の音を自動的に識別・分類する技術のこと。
AI電話応対 (ボイスボット) とは、 音声認識と音声合成を組み合わせ、 電話での問い合わせ・予約対応を AI が自動でこなす仕組みのこと。
バージイン(割り込み発話検知)とは、AIが音声で応答中にユーザーが話し始めたことを検知し、AI側の発話を即座に停止してユーザー発話を優先する仕組みのこと。
ビデオ・トゥ・オーディオ(V2A)とは、無音の動画に対して映像の動きや場面に合わせた効果音・環境音・音楽を自動生成し付加するAI技術のこと。
AIオーディオブック生成とは、書籍やテキスト原稿をAI音声合成で読み上げ、聞ける音声コンテンツに自動変換する技術のこと。
Diaとは、米Nari Labsが開発したオープンソースの対話音声合成AIモデルで、台本から笑い声や咳払いなどの非言語音まで一括生成できる技術のことである。
Orpheusとは、Canopy Labsが公開したLlamaベースのオープンソース音声合成(TTS)モデルのこと。感情豊かな音声をストリーミング生成できる点が特徴とされる。
音声ディープフェイク検出とは、AI音声合成や声質変換によって作られた偽の音声・なりすまし音声を、波形の不自然さや生成モデル特有のノイズパターンから機械学習で識別する技術のこと。
リアルタイムボイスチェンジャーとは、マイク入力の声をAIモデルで数十〜数百ミリ秒の低遅延のまま別人の声質へ変換し、配信や通話でそのまま使う技術のこと。
音声要約とは、会議や講演の音声データをAIが自動で文字起こしし、要点・決定事項・アクションアイテムを抽出して短くまとめる技術のこと。
VALL-Eとは、数秒のサンプル音声だけで話者の声質を再現し、追加学習なしにテキストを読み上げさせるゼロショット音声合成モデルのこと。
ボコーダー(Vocoder)とは、声の周波数特徴を分析・パラメータ化し、別の音源や合成波形にのせて再構成する音声合成・変換技術のこと。
ビート検出とは、音楽データの中からリズムの基準となる拍(ビート)の位置やテンポを自動的に解析・特定する技術のこと。
音高推定とは、音声や楽音の波形から基本周波数(F0)を推定し、声やメロディの高さを数値・時系列データとして抽出する技術のこと。
音楽情報検索(MIR)とは、楽曲の音響信号やメタデータから、テンポ・キー・和音・ジャンル・類似度などの情報を自動抽出・分析する技術分野のこと。
AI音声編集とは、音声データ内の「えー」「あの」などのフィラーや無音区間をAIが自動検出して除去し、聞きやすく整える技術のこと。
音声言語理解(SLU)とは、音声認識で文字化した発話から意図やエンティティを抽出し、システムが人間の発話内容を理解できる形に変換する技術のこと。
残響除去(Dereverberation)とは、録音音声に含まれる部屋の反響・残響成分をAI処理で低減し、発話の明瞭度を高める音声処理技術のこと。
AI歌詞生成とは、テーマやジャンル、感情の起伏などを指定するだけでAIが楽曲の歌詞案を自動生成する技術のことを指す。
通話分析とは、コールセンターなどの音声通話をAIが自動でテキスト化・解析し、顧客感情や会話内容から傾向を抽出する技術のこと。
伴奏生成とは、入力したメロディやボーカルに合わせてAIがコード進行・リズム・楽器パートを自動作曲し、楽曲の伴奏トラックを生成する技術のこと。
音声トークンとは、音声データを音声合成・音声認識AIが処理できるよう離散的な単位に分割したもののこと。
アクセント変換とは、話者の声質や発話内容を保ったまま、発音のアクセント(訛り)だけを別のアクセントに置き換える音声AI技術のこと。
コード進行生成とは、AIがジャンルやムード、キーを指定するだけで音楽的に自然な和音の並び(コード進行)を自動生成する技術のこと。
Cartesiaとは、State Space Model(SSM)系アーキテクチャを用いた低遅延音声合成(TTS)モデルを開発するスタートアップ、またはそのモデル自体を指す言葉のこと。
CosyVoiceとは、アリババグループの研究チームが開発したオープンソースの音声合成(TTS)モデルで、数秒の音声サンプルから話者の声質を再現するゼロショット音声クローンに対応する技術のこと。
Chatterbox(チャッターボックス)とは、Resemble AIが公開したオープンソースの音声合成(TTS)モデルで、短い音声から声を再現し感情の強さも調整できる技術のこと。
空間オーディオ生成とは、AIが音源の位置や広がりを立体的に再現し、没入感のあるサウンドを自動生成する技術のこと。
自動採譜とは、演奏や歌声の音声データをAIが解析し、楽譜やMIDIなどの記譜データへ自動変換する技術のこと。
多言語ボイスクローンとは、話者本人の声質・抑揚・話し方の特徴を保持したまま、学習していない別の言語で発話を合成する技術のこと。
メルスペクトログラムとは、音声波形の周波数成分を人間の聴覚特性に近いメル尺度で分割し、時間軸に沿って表現した2次元の音響特徴量のこと。
音素(Phoneme)とは、ある言語において意味の違いを生み出す最小の音声単位で、音声認識・音声合成の基本構成要素のことである。
MFCCとは、音声波形を人間の聴覚特性に近いメル尺度でスペクトル分析し、少ない係数で音色的特徴を圧縮表現する、音声認識・話者識別で広く使われる特徴量のこと。
ラウドネス正規化とは、音声や音楽の体感音量をLUFS基準で自動的に均一化し、視聴環境間の音量差をなくす技術のこと。
サウンドスケープ生成とは、AIが環境音・BGM・効果音を自動合成し、没入感のある背景音響を作り出す技術のこと。
VOICEVOXとは、個人開発者ヒロシバ氏によって開発された無料の日本語音声合成ソフトウェアのことで、テキストを入力するだけでキャラクターごとに異なるアニメ調の音声を生成できる。
Style-Bert-VITS2とは、感情やスタイルを指定して自然な日本語音声を合成できるオープンソース(OSS)の音声合成エンジンのこと。
RVCとは、検索ベース音声変換(Retrieval-based Voice Conversion)により、入力音声のピッチやニュアンスを保ったまま話者の声質を別の声に変換するAI音声技術のこと。
発音辞書(読み辞書)とは、音声合成AIや音声認識システムが専門用語・固有名詞・略語を正しい読み方で発音・認識できるよう、単語ごとに読みやアクセントを登録しておく辞書データのことである。
VUIとは、画面やボタン操作の代わりに話し言葉だけで家電やアプリを操作できる音声ベースの対話インターフェースのこと。
楽曲延長(Song Extension)とは、AI音楽生成サービスが最初に作った楽曲の続きを自動生成し、曲の尺を延ばす機能のこと。
テキスト正規化とは、数字・日付・略語・記号などをTTS/ASRが読み上げやすい表記に統一的に変換する前処理のこと。
カスタム語彙登録とは、音声認識(ASR)や音声合成(TTS)のAIに専門用語・固有名詞・社名などの単語リストを事前登録し、認識精度や発音の自然さを高める仕組みのこと。
ストリーミングTTSとは、テキストを音声に変換する処理の完了を待たずに、生成済みの音声チャンクを逐次再生することで応答の体感遅延を大幅に短縮する音声合成方式のこと。
音声匿名化とは、録音データから話者を特定できる特徴を除去・変換し、発話内容は保ったまま個人を識別できなくする技術のこと。
AivisSpeechとは、感情豊かなキャラクターボイスを無料で生成できるオープンソースの日本語テキスト音声合成エンジンのこと。
音声埋め込みとは、音声の特徴量を高次元の数値ベクトルに変換し、話者識別や検索、分類などのAI処理で扱いやすくする技術のこと。
言語識別とは、音声やテキストデータに含まれる言語が何語であるかをAIモデルが自動的に判定する技術のこと。
句読点付与とは、音声認識などで得られた句読点なしのテキストに、文脈から適切な句点・読点を自動挿入する技術のこと。
CoeFontとは、少量の音声データから声質を学習し、入力テキストを自然な読み上げ音声に変換する日本語対応のAI音声合成サービスのこと。
サンプリングレートとは、1秒間にアナログ音声を何回サンプル(標本)としてデジタル化するかを示す単位のこと。
Riffusionとは、音声波形をスペクトログラム画像に変換し、画像生成モデルの技術(Stable Diffusion系の拡散モデル)を応用して音楽を生成するAIモデルのこと。
ReazonSpeechとは、テレビ放送音声から構築された国内最大級の日本語音声認識用オープンコーパスのこと。
楽曲構成タグとは、AI作曲サービスへのプロンプトで[Verse]や[Chorus]のように曲のセクション構成を指定する記法のこと。
エコーキャンセル(AEC)とは、スピーカーの音がマイクに回り込んで生じるハウリングや反響音を、信号処理でリアルタイムに打ち消す技術のこと。
kotoba-whisperとは、OpenAIのWhisperを日本語音声に特化して蒸留・軽量化した音声認識モデルのことである。
AIミキシングとは、AIが複数の音声トラックの音量バランスやEQ、コンプレッションを自動で調整し楽曲を仕上げる技術のこと。
文字起こしのLLM補正とは、音声認識(ASR)が出力した書き起こしテキストの誤字・脱字・不自然な言い回しをLLMが文脈から自動修正する後処理のこと。
Stable Audioとは、Stability AIが開発したテキストから音楽・効果音を生成できるAIモデルのこと。オープンウェイト版と商用API版がある。
ロイヤリティフリーAI音楽とは、 AI で生成した楽曲を 追加使用料なしで 商用利用できるライセンス形態のこと。
ボイスライブラリとは、AI音声合成サービスが用意する多数のボイス(声質・言語・話者性別など)から目的に応じて選び、ナレーションや音声出力に利用できる音声素材集のことである。
相槌生成(Backchannel)とは、音声対話AIが会話中に「うん」「はい」「なるほど」等の相槌を自然なタイミングで挿入し、間合いを埋める技術のこと。
WebRTCとは、ブラウザやスマホアプリ同士が専用サーバーを介さずリアルタイムで音声・映像を送受信できるオープン標準の通信技術のこと。
目的話者抽出とは、複数の話者が同時に発話する音声の中から、特定の目的話者の声だけを分離抽出する音声処理技術のこと。
RTF(実時間係数)とは、音声処理にかかった時間を音声の長さで割った指標のこと。1未満なら実時間より高速、1超なら実時間より低速な処理を意味する。
音響キャプション生成とは、足音や犬の鳴き声、拍手といった音声以外の環境音・効果音をAIが自然言語の説明文に変換する技術のこと。
方言対応とは、音声認識や音声合成AIが標準語以外の地域方言の発音・語彙・イントネーションを正しく認識・処理する機能のこと。
SIP電話網接続 (Telephony連携) とは、AI音声エージェントをSIPプロトコル経由で固定電話・PBX・コールセンターシステムに接続し、電話回線上で音声対話を実現する仕組みのこと。
話者埋め込み(Speaker Embedding)とは、音声から声の特徴を固定長のベクトルに変換し、話者ごとの声紋として識別・比較できるようにする技術のこと。
単語単位タイムスタンプとは、音声を文字起こしする際に各単語ごとの発話開始・終了時刻をミリ秒単位で記録する技術のこと。
ビームフォーミング (マイクアレイ集音) とは、 複数のマイクを配列 (アレイ) 状に並べ、 位相差を演算処理して 特定方向の音だけを強調して拾う技術のこと。
話速制御(スピーキングレート)とは、音声合成AIが読み上げる速さを数値で細かく調整できる機能のこと。
Content ID とは音声・動画中の著作権保護コンテンツを音響指紋照合で自動検出する仕組みのこと。
ハミング検索とは、ユーザーが鼻歌やハミングで入力したメロディーを音響特徴量に変換し、既存楽曲データベースと照合して曲名を特定する音声検索技術のこと。
楽曲スタイル参照(Audio Reference)とは、既存の楽曲や音声クリップを手本としてAIに読み込ませ、その曲調・音色・アレンジ傾向を反映した新規楽曲を生成させる手法のこと。
音声認識の幻覚とは、音声認識AIが雑音や無音区間を誤解釈し、実際には話されていない単語や文を書き起こしてしまう現象のことをいう。
faster-whisperとは、OpenAIの音声認識モデルWhisperをCTranslate2エンジンで再実装し、推論を高速化・軽量化したオープンソース実装のこと。
音声フィンガープリントとは、音声データから特徴的なパターンを抽出し、短いデジタル指紋(ハッシュ値)に変換して識別・照合する技術のこと。
マルチトラック音楽生成とは、ボーカル・ドラム・ベースなど楽器パートごとに独立したトラック(ステム)を生成し、後から個別に編集・ミックスできるAI音楽生成方式のこと。
フォーリー生成とは、映像に合わせた足音や衣擦れ、物の操作音といった環境音効果をAIが自動で作り出す技術のこと。
Parakeetとは、NVIDIAが開発した高速な音声認識(ASR)モデル群のことで、少ない計算コストで高精度な文字起こしを実現する。
AI楽曲判定とは、楽曲がAI生成モデルによって作られたものか人間の制作かを、音響的特徴やメタデータの解析によって識別する技術のこと。
遠方音声認識(Far-field ASR)とは、話者から数メートル離れたマイクでも雑音や反響がある環境で高精度に発話を認識する音声認識技術のこと。
演技指示付きTTSとは、テキストプロンプトで声の抑揚・感情・話し方を指示しながら音声を生成できる音声合成技術のこと。
AI楽曲の配信規約とは、SpotifyやApple Musicなど主要ストリーミング各社がAI生成楽曲の配信可否や収益化条件について定める運用ルールのことである。
話者属性推定とは、録音音声の声質や話し方の特徴をAIが解析し、話者の年齢層や性別などの属性を推定する技術のこと。
SN比とは、音声や音楽の信号成分と雑音成分の強さの比率をデシベル (dB) で表した、録音・再生機器や音声AIの品質を測る基本指標のこと。
コードスイッチング音声認識とは、1つの発話の中で日本語と英語のように複数言語が入り混じる音声を、言語を切り替えずに単一モデルでそのまま高精度にテキスト化する音声認識技術のこと。
評価指標 (151)
カテゴリ単独で見る →MMLU / HumanEval / ArenaなどAIの評価軸
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
レイテンシとは、AIモデルにリクエストを送信してから最初のレスポンスが返るまでの応答時間のこと。
トークン毎秒 (スループット) とは、LLM が1秒間に生成・処理できるトークン数を示す性能指標のこと。値が大きいほど応答が速く、リアルタイム用途や大量一括処理に向く。
LLM-as-a-Judgeとは、あるLLMの出力品質を別のLLMが自動採点する評価手法のこと。人手評価の代替として広く使われる。
ARC-AGIとは、François Cholletが設計したAIの汎用推論能力を測る公開ベンチマークのこと。人間には自明な図形パターン推論タスクで構成され、AGI到達度の代表指標として業界で広く参照される。
AIMEとは、米国の難関数学競技試験「アメリカ数学招待試験」を転用したAIモデルの高度な数学的推論能力を測るベンチマークのこと。
ベンチマーク汚染とは、AIモデルの訓練データにテスト用評価データが混入し、性能スコアが実際の能力より高く見える現象のこと。
TTFTとはLLMへのリクエスト送信から最初のトークンが返ってくるまでの時間のこと。ユーザーが「反応している」と体感する待ち時間を左右する、応答速度の核心指標。
pass@kとはコード生成AIが生成したk個のコードサンプルのうち、少なくとも1つが全ユニットテストを通過する確率を示す評価指標のこと。
BLEUとは機械翻訳や文章生成の品質を人間の参照訳と比較してスコア化する自動評価指標のこと。
Eloレーティングとは、チェスで生まれた相対的な強さの数値化手法をAIモデル評価に転用したスコアリングシステムのこと。
τ-benchとはAIエージェントのツール使用・多段階タスク遂行能力を、現実に近いシナリオで統計的に評価するベンチマークのこと。
MMMUとはテキストと画像を組み合わせた大学レベルの専門問題でマルチモーダルAIの総合理解力を測るベンチマークのこと。医学・法律・工学など30以上の学術分野の11,500問以上で構成される。
幻覚率とは、AIが事実と異なる情報を生成する割合を数値化した評価指標のこと。モデルの信頼性を測る基本指標として、本番導入前の検証フェーズで必ず確認される。
忠実性とは、AIが生成したテキストが参照元の文書や提供されたコンテキストにどれだけ正確に基づいているかを測る評価指標のこと。
HLEとはScale AIとCenter for AI Safety(CAIS)が2025年に公開した、博士課程レベルの難問2,500問でAIの推論限界を測る超難関ベンチマークのこと。
LiveCodeBenchとは、LeetCodeなどの競技プログラミングサイトから継続的に新問題を収集し、学習データ汚染を排除した条件でLLMのコーディング能力を客観評価するベンチマークのこと。
RAGASとはRAGシステムの回答品質を自動評価するオープンソースフレームワークのこと。忠実性・回答適合性・文脈精度・文脈網羅性の4指標をLLMジャッジで採点し、チューニングの効果を定量化する。
WER(単語誤り率)とは、音声認識・文字起こし・機械翻訳の精度を数値化する業界標準の評価指標のこと。正解テキストとの差異(置換・削除・挿入)の合計語数を正解語数で割った値で、低いほど高精度を示す。
Needle in a Haystackとは、LLMが長文の中から特定情報を正確に取り出せるかを測る評価手法のこと。コンテキストウィンドウの実効性能を埋め込み位置別に可視化でき、RAG設計の基準指標として使われる。
MT-Benchとは、LLMの多段対話能力をGPT-4が自動採点する標準ベンチマークのこと。8カテゴリ80問の2ターン問答で推論・コーディング・作文などを1〜10点で評価する。
Recall@kとは、検索・推薦システムが上位k件の結果の中に、正解となる関連アイテムをどの割合で含めているかを測る評価指標のこと。
ROUGEとはLLMや機械翻訳が生成したテキストを参照テキストとのn-gram一致率で自動採点する要約評価指標のこと。
タスク単価とは、AIが特定のタスクを1件完了するのにかかるコストの総額を指す評価指標のこと。
F1スコアとは、分類モデルの適合率(Precision)と再現率(Recall)を調和平均した評価指標のこと。どちらかが低いと値が大きく下がるため、不均衡データの性能評価に広く用いられる。
パープレキシティとは、言語モデルがテキストをどれほど的確に予測できるかを数値で示す評価指標のこと。値が低いほど予測精度が高く、LLMの開発・比較・ファインチューニング評価で広く用いられる。
BERTScoreとは、BERTの文脈埋め込みでテキスト生成の意味的品質を測る評価指標のこと。表層一致のBLEU/ROUGEより人間の感覚に近く、言い換えや同義表現にも高スコアを出せる。
人手評価とは、AIが生成したテキストや画像などの出力品質を、人間が直接採点・判定するモデル評価手法のこと。
GAIAとはMeta AIらが開発した汎用AIアシスタント向けの難易度別評価ベンチマークのこと。実世界の複合タスクをどこまで正確に解けるかを多段階で測る。
SimpleQAとは、OpenAIが2024年に公開した、短答式の事実確認クイズでLLMの正答率と幻覚(誤答)傾向を測るベンチマークのこと。
MMLU-Proとは、既存のMMLUベンチマークを難化させ、選択肢を10択に増やして推論力を重視したLLM評価基準のこと。
FrontierMathとは、専門家でも解くのに数時間から数日かかる高難度の数学問題群でAIモデルの推論能力を測定する最難関ベンチマークのこと。
BFCLとは、LLM(大規模言語モデル)が外部ツールやAPIを状況に応じ正確に呼び出せるかを測る関数呼び出し評価ベンチマークのこと。
知能指数(Artificial Analysis Intelligence Index)とは、複数の第三者ベンチマーク結果を統合し、LLMの総合的な性能を単一のスコアで示す評価指標のこと。
WebArenaとは、AIエージェントが実際のWebサイト上でショッピングや予約、情報検索などのタスクをどこまで自律的にこなせるかを測る評価用ベンチマークのこと。
Terminal-Benchとは、AIエージェントがターミナル上で実務的なタスクをどれだけ自律的にこなせるかを測定する評価ベンチマークのこと。
GDPvalとは、OpenAIが2025年に公開した、AIモデルが実際の経済的価値を生む業務をどれだけこなせるかを測るベンチマークのこと。
LongBenchとは、大規模言語モデルが長い文脈をどれだけ正確に理解・処理できるかを測る多タスク・多言語対応のベンチマークのこと。
MOSとは、合成音声や生成コンテンツの品質を人間の主観評価によって1〜5点で数値化する評価指標のこと。
LiveBench(ライブベンチ)とは、推論・数学・コーディングなど複数分野でLLMを横断評価し、データ汚染を避けるため毎月問題を更新し続ける総合ベンチマークのこと。
Aider Polyglotとは、AIペアプログラミングツールAiderが公開する、複数言語にまたがるコード編集ベンチマークのこと。
SWE-Lancerとは、実在のフリーランス案件と実際の報酬額をもとに、AIモデルのソフトウェア開発能力を経済価値で測定するベンチマークのことである。
タスク成功率とは、AIエージェントに任せた一連のタスクが、人手を介さず最後まで正しく完了できた割合のこと。
GSM8Kとは、小学校高学年レベルの算数文章題を8,500問収録した、大規模言語モデルの多段階推論能力を測定するベンチマークのこと。
HellaSwagとは、状況の説明文に続く自然な文章を4択から選ばせ、AIモデルの常識的推論能力を測定するベンチマークのこと。
TruthfulQA(真実性ベンチ)とは、大規模言語モデルが人間に広く見られる誤解や俗説に引きずられず、事実に基づいた正確な回答を返せるかを測定するベンチマークのこと。
IFEvalとは、大規模言語モデルが「300字以内で書け」などの具体的な指示にどれだけ正確に従えるかを機械的に採点する指示追従ベンチマークのこと。
FIDとは、生成画像と実画像の特徴量分布の差を数値化し、画像生成モデルの品質を客観的に評価する指標のこと。
CLIPスコアとは、生成画像とテキスト説明の意味的な一致度を数値化した評価指標のこと。
JGLUEとは、日本語の自然言語処理モデルの言語理解能力を測るために東京大学・早稲田大学・ヤフーが共同開発したベンチマークデータセット群のこと。
Nejumiリーダーボードとは、Weights & Biasesが公開する日本語LLMの性能を横断比較するベンチマークランキングのこと。
VBenchとは、動画生成AIの画質・一貫性・動きの自然さなど複数の観点を定量スコア化するオープンソースの評価ベンチマークのこと。
ゴールデンデータセットとは AI の出力精度を測るために人手で作った「模範解答付き」の評価用データ集のこと。
BrowseCompとは、AIエージェントが自力でWeb検索・閲覧を重ねて発見しづらい事実情報を見つけ出す能力を測定するベンチマークのこと。
OSWorldとは、AIエージェントが実際のデスクトップOS環境(Ubuntu・Windows・macOS相当)でファイル操作やアプリ操作を自律的にこなせるかを測る評価ベンチマークのこと。
Vending-Bench とは AI エージェントに自動販売機の運営を模擬させ、 長時間の一貫した意思決定力を測るベンチマークのこと。
MRCR(多重参照検索ベンチ)とは、長いコンテキストの中に似た複数の参照情報を埋め込み、LLMが正しい参照を区別・抽出できるかを測る長文脈評価指標のこと。
FACTS Groundingとは、Google DeepMindが2024年に公開した、LLMの回答が与えられた文書にどれだけ忠実に基づいているかを測定するベンチマークのこと。
MBPPとは、初級者向けのPythonプログラミング問題集を使い、AIモデルのコード生成精度をpass@k形式で測定する評価ベンチマークのこと。
MATHとは、高校数学コンテスト水準の問題12,500問(難易度1〜5段階)で構成され、LLMの数式推論能力を測るために広く使われるベンチマークデータセットのこと。
BBHとは、200以上のタスクを含むBIG-Benchの中から、従来のLLMが人間の平均正答率を下回った23の難問タスクだけを抽出した評価指標セットのこと。
MRR(Mean Reciprocal Rank)とは、検索結果の中で最初に正解が出現した順位の逆数を、複数クエリで平均した情報検索の評価指標のこと。
NDCGとは、検索やレコメンドの順位付け結果について、関連度の高い項目が上位に来ているほど高いスコアになるよう設計された評価指標のこと。
適合率・再現率とは、分類モデルの予測精度を測る2つの指標で、適合率は誤検知の少なさ、再現率は見逃しの少なさを表す評価軸のこと。
混同行列(Confusion Matrix)とは、分類モデルの予測結果を実際の正解ラベルと突き合わせ、真陽性・偽陽性・真陰性・偽陰性の件数を表形式に整理した評価指標のこと。
AUC-ROCとは、機械学習モデルの分類性能を0から1の数値で表す評価指標で、ROC曲線の下側の面積を意味する。
キャリブレーションとは、モデルが出力する予測確率(確信度)が実際の正解率とどれだけ一致しているかを示す指標のこと。
AgentBenchとは、LLM(大規模言語モデル)をコーディングやゲーム、ウェブ操作など複数の環境でエージェントとして動作させ、タスク遂行能力を横断的に評価するベンチマークのこと。
HELMとは、Stanford大学の研究チームが開発した、LLMの性能を精度・公平性・堅牢性・効率性など複数の指標で横断的に評価するオープンな評価フレームワークのこと。
SWE-bench Verifiedとは、実GitHubリポジトリのバグ修正課題をAIがどれだけ解決できるか、人手で精査した500件の厳選タスクで測るコーディング評価指標のこと。
ARC-AGI-2とは、初見の図形パズルでAIの抽象的推論力を測るベンチマークARC-AGIの改良版で、記憶や物量では解けない汎用知能寄りの評価指標のこと。
MGSMとは、英語の数学文章題ベンチマークGSM8Kを日本語・中国語・スワヒリ語など複数言語に翻訳し、LLMの多言語数学推論力を測るベンチマークのこと。
コスト性能フロンティアとは、精度とコストのトレードオフにおいて、他のどの選択肢よりも優れた組み合わせだけを結んだ境界線のこと。
WildBenchとは、実際のユーザーが投稿した多様で難易度の高いチャットログをもとに、LLMの応答品質をタスクごとのチェックリストで採点する評価ベンチマークのこと。
τ²-bench(タウツーベンチ)とは、AIエージェントが複数ターンの対話とツール呼び出しを組み合わせたタスクをどれだけ正確にこなせるかを測定する評価ベンチマークのこと。
Arena-Hardとは、LMSYSが実ユーザーの投稿から抽出した高難度プロンプト集でLLM同士の応答品質をペア比較評価するベンチマークのこと。
Video-MMEとは、マルチモーダルAIモデルの動画理解能力を、短尺から長尺までの多様な動画と質問応答セットで測定するベンチマークのこと。
HealthBenchとは、大規模言語モデルが医療関連の質問にどれだけ正確かつ安全に応答できるかを測定するために設計された評価ベンチマークのこと。
SciCodeとは、物理学・化学・生物学など科学研究分野の実践的なコード生成能力をLLMに問うベンチマークのこと。
正解率(Accuracy)とは、分類モデルの全予測件数のうち、正しく予測できた件数の割合を示す評価指標のこと。
完全一致(Exact Match)とは、モデルの出力が正解ラベルや参照文字列と一字一句同じかどうかで判定する評価指標のこと。
Cohen's Kappaとは、2人の評価者やモデルによるラベル判定の一致度から、偶然による一致分を差し引いて算出する統計指標のこと。
ChartQAとは、棒グラフや折れ線グラフなど図表画像と質問をセットで与え、AIモデルが図表から数値や傾向を正しく読み取れるかを測る画像質問応答ベンチマークのこと。
DocVQAとは、スキャンした請求書や契約書などの文書画像に対して質問応答を行わせ、AIモデルの文書理解力・OCR精度を測定するベンチマークのこと。
JMMLUとは、人文・社会・自然科学など56分野の四択問題で日本語LLMの知識理解力を測定するベンチマークのこと。
MTEBとは埋め込みモデルの検索・分類・クラスタリングなど複数タスクの性能を横断的に比較するベンチマークのこと。
Heron-Benchとは、日本の文化・状況を含む画像を用いて、VLM(視覚言語モデル)の日本語での画像理解力を評価するベンチマークのこと。
プロンプト回帰テストとは、プロンプトやモデルを変更した際に、既存の入出力品質が意図せず劣化していないかを事前に用意したテストケース集で自動検証する評価手法のこと。
MLPerfとは、機械学習モデルの学習・推論の速度や電力効率を統一条件で比較する業界標準ベンチマークスイートのこと。
ベンチマーク飽和とは、AIモデルの性能向上によって主要ベンチマークで上位モデルのスコアが軒並み高得点に張り付き、モデル間の実力差を判別できなくなる現象のこと。
RULERとは、大規模言語モデル(LLM)が主張する文脈長で実際にどこまで情報を正確に扱えるかを、検索・追跡・集約など複数タスクで測定するベンチマークのこと。
エラー分析とは、AIモデルが出力した誤りを収集・分類し、原因パターンを特定して精度改善につなげる評価プロセスのこと。
デフレクション率(自己解決率)とは、顧客からの問い合わせのうち、有人対応に至らずチャットボットやFAQで自己解決した割合を示すカスタマーサポート指標のこと。
有害性スコア(Toxicity)とは、AIが生成する文章に含まれる差別・暴力・ハラスメントなどの有害度合いを数値化した評価指標のこと。
百万トークン単価とは、LLM APIの利用料金を100万トークン処理あたりの金額で表す評価指標のこと。
位置バイアス(Position Bias)とは、LLM評価や検索ランキングで、内容の質ではなく提示順序(先頭か末尾か)によって評価や選択結果が偏ってしまう現象のこと。
オンライン評価とは、本番環境で実際のユーザー入力に対するAIモデルの応答品質を継続的に監視・評価する手法のこと。
トークン効率とは、LLMへの入出力に使うトークン数あたりでどれだけの性能や成果を引き出せるかを示す指標のことである。
SWE-bench Proとは、旧来のSWE-bench Verifiedがスコア飽和・汚染で実力差を測れなくなった反省から作られた、より難しい実務規模のコーディング能力評価ベンチマークのこと。
MultiChallengeとは、大規模言語モデルが複数ターンにわたる対話で指示を正確に保持し一貫して応答できるかを測る評価ベンチマークのこと。
トラジェクトリ評価とは、AIエージェントが目的達成までに行った一連の行動・判断(ツール呼び出しや推論ステップ)の履歴を評価する手法のこと。
ルーブリック評価とは、AI出力や成果物を複数の評価観点と段階別の基準文で採点し、評価者間のブレを抑えて一貫した判定を行う手法のこと。
JQaRAとは、日本語RAGシステムの検索精度を測定するために公開されたベンチマークデータセットのことである。
AgentHarmとは、AIエージェントが詐欺やサイバー攻撃など有害なマルチステップタスクをどこまで実行してしまうかを測定するベンチマークのこと。
セマンティックエントロピーとは、 同一の問いに対する LLM の複数回答を意味単位でクラスタリングし、 そのばらつきの大きさからハルシネーションの可能性を検知する指標のこと。
統計的有意性とは、AIモデルやA/Bテストの評価結果の差が偶然のばらつきではないと言えるかどうかを示す統計的な基準のことで、信頼区間の幅などで判定される。
P95レイテンシとは、リクエストの応答時間を速い順に並べたとき、下から95%目に位置する値のことで、平均値では見えない一部の遅い処理(テール遅延)を可視化する指標のこと。
JMTEBとは、日本語のテキスト埋め込みモデルの性能を検索・分類・クラスタリング・STSなど複数タスクで横断的に評価するベンチマークのこと。
BEIRとは、質問応答や事実検証など性質の異なる複数タスクを横断してゼロショットで検索モデルの精度を測る評価用ベンチマークのこと。
JHumanEvalとは、コード生成AIの性能を日本語のdocstringやコメント環境下で測定するために作られた評価ベンチマークのこと。
COMETとは、事前学習済み多言語モデルの埋め込みを使い、機械翻訳の品質を人間の評価と高い相関でスコア化する自動評価指標のこと。
MMAUとは、音声・環境音・音楽という3領域を横断する質問応答タスクで、音声対応AIモデルの理解力を単一の指標で比較できるようにしたベンチマークのこと。
GenEvalとは、画像生成AIがプロンプトの指示(オブジェクト数・色・位置関係など)をどれだけ正確に画像へ反映できるかを測る評価ベンチマークのこと。
CSAT とは、 AI チャットボットや音声応対など カスタマーサポート業務について 利用者がどれだけ満足したかを 数値で示す指標のこと。
LegalBenchとは、契約解釈や規則適用など162種の法務推論タスクで構成された、大規模言語モデルの法的推論能力を測るオープンベンチマークのことである。
TheAgentCompanyとは、LLMエージェントに模擬ソフトウェア企業内で175件の実務タスクを遂行させ、完了率で実力を測るベンチマークのこと。
FActScoreとは、生成された長文を細かい事実単位(atomic facts)に分解し、各事実を外部知識源と照合して正誤を判定する事実性評価指標のこと。
モデルドリフトとは、本番稼働中のAIモデルの予測精度や出力品質が、学習時点と現在の入力データやユーザー行動の変化によって時間とともに低下していく現象のこと。
タスク時間地平とは、AIエージェントが50%の確率で完遂できるタスクの長さを、人間換算の作業時間で表した能力指標のことである。
引用正確性とは、AI が生成した回答に含まれる引用・出典の内容が、実際の一次情報の記述と正確に一致しているかどうかを測る評価指標のこと。
シャドー評価とは、新しいモデルやプロンプトを本番トラフィックに並行して流し、ユーザーへ出力を見せないまま品質を比較検証する評価手法のこと。
Style Controlとは、LLMベンチマークの人間評価で生じる回答の長さや太字・箇条書きなど見た目の装飾による偏りを統計的に補正し、内容の質だけを測る評価手法のこと。
llm-jp-evalとは、LLM-jpコンソーシアムが公開する、日本語LLMの性能を複数タスクで横断評価できるオープンソースの評価ハーネスのこと。
ELYZA-tasks-100とは、日本語LLMの複雑な指示追従能力を100件の多様なタスクで評価するベンチマークのこと。
pass^kとは、生成AIモデルに同一タスクをk回実行させ、k回すべてが正解・成功した割合で信頼性を測る一貫性評価指標のこと。
回答関連性とは、LLMが生成した回答が、入力された質問の意図や文脈にどれだけ的確に対応しているかを測るRAG評価指標のこと。
SelfCheckGPTとは、追加の外部知識やAPIアクセスなしに、同じ質問へのLLMの複数回答のばらつきを比較して幻覚(事実と異なる出力)を検知する手法のこと。
ツール選択精度とは、AIエージェントが与えられたタスクに対して複数の外部ツールやAPIの中から正しいものを選び、適切な引数で呼び出せる割合を示す評価指標のこと。
攻撃成功率とは、脱獄プロンプトなど敵対的な入力が生成AIの安全対策を突破し、意図しない有害な出力を引き出せた試行の割合のこと。
CER(文字誤り率)とは、音声認識やOCRの出力結果を正解データと比較し、誤って認識された文字の割合を示す評価指標のこと。
BIRDとは、実データベース規模でText-to-SQLモデルの精度を測る代表的な評価ベンチマークのこと。
HaluEvalとは、LLMが生成した回答の幻覚(事実と異なる内容)を検知できるかを測定するために構築されたベンチマークデータセットのこと。
AnswerCarefullyとは、理化学研究所と国立情報学研究所が日本語LLMの安全な応答を評価・訓練するために公開した、有害カテゴリ別の質問応答データセットのことである。
勝率とは、AIモデルや出力同士を対戦形式で比較したときに、特定のモデルが相手より高く評価された割合のことである。
コンテキスト適合率とは、RAGが検索した文脈情報のうち、実際に回答生成に関連する情報がどれだけの割合を占めるかを示す評価指標のこと。
PESQとは、ITU-T勧告P.862で標準化された、音声通話やAI音声合成の品質を人の聴感に近い形で自動採点する客観指標のこと。
lm-evaluation-harnessとは、複数の標準ベンチマークでLLMの性能を自動評価するOSSツールのこと。
AHTとは、コールセンターやチャットサポートで、問い合わせ1件の受付から対応完了までにかかる平均時間のこと。
MMMU-Proとは、大学レベルの専門知識を問うマルチモーダルベンチマークMMMUを難化させ、選択肢を10択に増やしテキストのみで解ける設問を除去した、より厳格な評価指標のこと。
人手介入率とは、AIエージェントや自動化パイプラインが出した判断・出力のうち、人間による修正・承認・差し戻しを必要とした割合を示す指標のこと。
JailbreakBenchとは、LLMが安全ガイドラインを回避しようとする脱獄(ジェイルブレイク)攻撃への耐性を、標準化された攻撃プロンプト集と分類基準で評価するベンチマークのこと。
JMMMUとは、日本語かつ画像・図表を含む大学レベルの専門問題でAIの多モーダル理解力を測る評価ベンチマークのこと。
コンテキスト再現率とは、RAGなどの検索拡張生成において、正解に必要な情報を検索結果がどれだけ網羅できたかを示す評価指標のこと。
MathVistaとは、図表・グラフ・幾何図形など視覚情報を伴う数学問題でAIモデルの推論力を測る評価ベンチマークのこと。
SWE-bench Multimodalとは、UIのスクリーンショットを含むGitHub issueをAIエージェントに解決させ、視覚理解力を測る評価ベンチマークのこと。
ユーザーシミュレータ評価とは、実際のユーザーの代わりにAIモデルや台本化されたエージェントを用いて対話システムやAIエージェントの性能を自動評価する手法のこと。
インフラ・学習 (128)
カテゴリ単独で見る →GPU / 推論 / 量子化 / FP8など計算基盤
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
RLHFとは、人間の評価・フィードバックを報酬信号として活用し、LLMの出力を人間の意図に沿わせる強化学習手法のこと。
蒸留とは、大規模な「教師モデル」の知識を小規模な「生徒モデル」に転移させ、軽量化・高速化を図る機械学習の手法のこと。
量子化とはAIモデルの重みパラメータを低ビット精度に圧縮し、推論速度の向上・メモリ使用量の削減を実現する技術のこと。
MoE(混合エキスパート)とは、複数の専門サブネットワーク(エキスパート)を持ち、入力トークンごとに一部だけを活性化させるスパース型ニューラルネットワーク設計手法のこと。
DPO(直接選好最適化)とは、報酬モデルを使わずに人間の選好データから直接LLMを最適化するファインチューニング手法のこと。
事前学習とは、大規模言語モデルをインターネット上の膨大なテキストデータで学習させ、汎用的な言語理解・生成能力を獲得させる訓練フェーズのこと。
FlashAttentionとはTransformerの注意機構をGPUメモリ階層を活かして高速・省メモリで実行するアルゴリズムのこと。長文脈処理の計算コストを大幅に削減する。
KVキャッシュとは、LMの推論時に自己注意機構のキー(K)・バリュー(V)行列を再計算せずメモリ上に保持する高速化技術のこと。
vLLMとはオープンソースのLLM推論フレームワークのこと。独自のPagedAttentionアルゴリズムで高スループットを実現し、自社GPUサーバ上にOpenAI互換APIを構築できる。
FP8とは8ビットの浮動小数点形式でAIモデルの数値を表現する量子化技術のこと。従来のFP32・BF16より演算速度と省メモリを両立し、大規模モデルの学習・推論コストを大幅に削減する。
合成データとは、実データの統計的特性を模倣してAIが人工的に生成したデータのこと。個人情報保護や収集コストの削減を目的に、モデル学習・テスト用途で広く活用される。
投機的デコーディングとは、小さなドラフトモデルが先読みしたトークン列を大型モデルが並列検証することで推論速度を2〜4倍に高めるLLM高速化手法のこと。
GRPOとはグループ相対方策最適化のことで、強化学習を使ってLLMをファインチューニングする手法。複数の出力をグループ化し相対的な報酬で学習するため、従来のPPOより計算コストが低い。
スケーリング則とは、モデルサイズ・データ量・計算量を増やすほどAIの性能が予測可能な形で向上するという経験則のこと。
RLAIFとはAIモデルが別のAIに評価・フィードバックを与え、強化学習でモデル品質を向上させる学習手法のこと。人間ラベラーを介さずスケーラブルにモデルを改善できる点が最大の特徴。
報酬モデルとは、人間のフィードバックを学習し、AIの出力がどれだけ望ましいかをスコアリングするモデルのこと。
オンデバイスAIとは、クラウドサーバーへ送信せずデバイス本体(スマートフォン・PC・IoT機器など)上でAIモデルを直接推論・実行する技術のこと。
命令チューニングとは、事前学習済みの大規模言語モデルに対して「指示→理想回答」形式のデータで追加学習を行い、ユーザーの指示に従う能力を後付けする手法のこと。
憲法AIとは、AIモデルに「守るべき原則リスト(憲法)」を与えて自己批判と修正を繰り返させ、安全かつ倫理的な応答を引き出す訓練手法のこと。
モデルマージとは、複数の学習済みAIモデルのパラメーター(重み)を数学的に統合し、追加学習のコストをかけずに異なる能力を一つのモデルへ合成する技術のこと。
PEFTとは、大規模言語モデルの全パラメータを更新せず、LoRAなど少数パラメータのみを調整することで、低コスト・短時間でモデルを特定タスクに適応させる微調整手法群のこと。
強化学習とは、エージェントが環境との試行錯誤を通じて報酬を最大化する行動を自律的に習得する機械学習手法のこと。ChatGPT・ClaudeのRLHFチューニングにも使われる基盤技術。
連合学習とは、データを一箇所に集めずに各端末や組織のローカル環境でモデルを学習させ、更新した重みだけを共有してグローバルモデルを改善するプライバシー保護型の機械学習手法のこと。
過学習とは、モデルが訓練データに適合しすぎて未知データへの汎化性能が著しく低下する現象のこと。
TPUとはGoogleが開発したAI・機械学習専用のカスタムチップのこと。行列演算を高速化し、GPU比で数倍〜数十倍のスループットを実現する。
LLMOpsとはLLM(大規模言語モデル)の開発・評価・デプロイ・監視を一貫して管理するための運用基盤とプロセスの総称のこと。
連続バッチングとは、LLM推論サーバーが個々のリクエストの完了を待たずに新規リクエストをトークン単位で随時差し込みながら処理する方式のこと。
テンソル並列とは、巨大なニューラルネットワークの1層内の行列演算を複数のGPUに分割し、同時並行で計算させる並列化手法のこと。
RoPEとは、Transformer系のLLMでトークンの位置情報を回転行列によってQuery・Keyベクトルに埋め込む位置エンコーディング手法のこと。
モデルルーティングとは、入力されたタスクの内容や難易度に応じて、複数のAIモデルの中から最適なモデルへ自動的に振り分ける仕組みのこと。
QLoRAとは、大規模言語モデルを4bit量子化した状態でLoRA(低ランク適応)を適用し、少ないGPUメモリでファインチューニングする軽量学習手法のこと。
SGLangとは、大規模言語モデル(LLM)の推論処理を高速化するために設計されたオープンソースの推論サーバフレームワークのこと。
GQA(グループ化クエリ注意)とは、複数のクエリヘッドでKeyとValueをグループ単位で共有し、推論時のメモリ使用量と計算コストを抑える注意機構の一種のこと。
事後学習 (Post-training) とは、 事前学習を終えた LLM に SFT や RLHF などを追加適用し、 対話性・指示追従性・安全性を高める仕上げ工程のこと。
Blackwellとは、NVIDIAが2024年に発表した次世代GPUアーキテクチャの名称で、Hopper世代の後継として大規模AI学習・推論向けに設計された半導体基盤のこと。
AIアライメントとは、 AI の出力や振る舞いを 人間の意図・価値観・安全基準に一致させる技術と設計プロセスのこと。
グロッキングとは、ニューラルネットワークが訓練データを暗記した状態のまま学習を続けた末に、ある時点で汎化性能が急激に向上する現象のこと。
AIファクトリーとは、数万〜数十万基規模のGPUを集積し、大規模言語モデルの学習・推論に特化して設計された超大規模データセンターのことである。
MXFP4とは、4ビットの浮動小数点値をブロック単位の共有スケール係数と組み合わせて表現する軽量な数値量子化フォーマットのこと。
Ollama とは、LLM を自分の PC やサーバー上でダウンロードして動かせるローカル実行ツールのこと。
llama.cppとは、Meta社のLLaMA系モデルをCPU上でも高速に動かせるよう最適化されたC/C++製のオープンソース推論エンジンのこと。
GGUFとは、大規模言語モデルを量子化し、CPUやローカル環境でも高速に動作させるためのファイル形式のこと。
転移学習とは、ある課題で学習済みのモデルが持つ知識を別の関連課題に応用し、少ないデータや計算資源で新しいタスクに適応させる機械学習の手法のこと。
CUDAとは、NVIDIAのGPU上で並列計算を実行するためのプログラミングモデル・開発環境のことで、AI学習や推論の高速化に広く使われている。
GPUクラウド(GPUaaS)とは、AI学習・推論に必要な高性能GPUを、自社で購入・保守せずクラウド経由で必要な分だけ借りられるサービスのこと。
GENIACとは経済産業省とNEDOが生成AI基盤モデル開発を支援するために計算資源(GPU等)を提供する国のプログラムのこと。
NPU (ニューラル処理ユニット) とは、ニューラルネットワークの推論を専門に高速処理する半導体チップのこと。スマホやPCに搭載され、AI処理をCPU・GPUより低消費電力で実行する。
MLA(多頭潜在注意)とは、Transformerの推論時にKVキャッシュを低ランクの潜在ベクトルに圧縮し、メモリ使用量と計算コストを削減するAttention機構の改良版のこと。
スパースアテンションとは、Transformerの自己注意機構において全トークンペアを計算せず、重要な一部のみに絞って計算量とメモリを削減する手法のこと。
HBMとは、複数のDRAMチップを垂直に積層し、GPUなどのプロセッサ近傍に配置することで広帯域なデータ転送を実現するメモリ規格のこと。
FSDPとは、モデルのパラメータや勾配、オプティマイザ状態を複数GPUに分割して保持し、計算時にだけ必要な部分を集めて学習する分散学習手法のこと。
パイプライン並列とは、巨大なニューラルネットワークを層(レイヤー)単位で複数のGPUに分割し、ミニバッチを流れ作業のように順次処理させる並列学習・推論手法のこと。
PagedAttentionとは、LLM推論のKVキャッシュをOSのページング方式でブロック単位管理し、メモリ断片化を抑えて処理効率を高める仕組みのこと。
bfloat16(BF16)とは、指数部をFP32と同じ8ビット確保し仮数部を7ビットのみにした16ビット浮動小数点形式のこと。
勾配チェックポイントとは、モデル学習時に中間活性化を保存せず必要時に再計算することでGPUメモリ使用量を削減する手法のこと。
LPU(言語処理ユニット)とは、Groqが開発した大規模言語モデルの推論に特化した専用プロセッサのことで、GPUより高速かつ低遅延なトークン生成を実現する技術のこと。
Softmax(ソフトマックス関数)とは、複数の数値を合計が1になる確率分布に変換する関数のことで、ニューラルネットワークの分類やAttentionの出力に使われる。
自己教師あり学習とは、人手のラベル付けなしにデータ自体が持つ構造から予測タスクを自動生成し、その正解を使ってモデルを訓練する学習手法のこと。
YaRNとは、Transformerの位置エンコーディング(RoPE)を波長帯域ごとに補間・調整し、追加学習コストを抑えながらモデルのコンテキスト長を大幅に拡張する手法のこと。
MFU(モデルFLOPs利用率)とは、GPUの理論上の最大演算性能に対し、実際のモデル学習で引き出せている計算性能の割合のこと。
AWQとは、活性化値の分布をもとに重要な重みだけ精度を保ち、他を低ビット化するLLM量子化手法のこと。
破滅的忘却とは、AIモデルが新しいタスクやデータで追加学習を行うと、それまで習得していた知識やスキルの精度が急激に低下してしまう現象のこと。
コンテキスト並列とは、LLMの学習・推論において長大な入力系列をGPU間で分割し同時処理する並列化手法のこと。
NVFP4とは、NVIDIAが提唱する4ビット浮動小数点(FP4)のデータ形式で、AIモデルの学習・推論の演算量とメモリ使用量を削減する技術のこと。
Muonとは、隠れ層の重み行列の勾配更新をNewton-Schulz反復で直交化して適用する、大規模言語モデルの事前学習向け最適化アルゴリズムのこと。
学習率(Learning Rate)とは、ニューラルネットワークの学習でパラメータをどれだけ大きく更新するかを決めるハイパーパラメータのこと。
バッチサイズとは、機械学習モデルの学習において一度のパラメータ更新に使用する学習データのサンプル数のこと。
誤差逆伝播とは、ニューラルネットワークの出力誤差を逆方向にたどりながら各層の重みの勾配を計算し、学習を進めるアルゴリズムのこと。
ドロップアウトとは、ニューラルネットワークの学習時に一定確率でノードを無効化し、特定ニューロンへの依存を減らして過学習を防ぐ正則化手法のこと。
LiteLLMとは、OpenAIやAnthropicなど複数のLLMプロバイダーのAPIをOpenAI互換の単一インターフェースに統一して呼び出せるオープンソースのLLMプロキシ・統合APIのこと。
Hugging Faceとは、AIモデル・データセット・デモアプリを誰でも公開/検索/共有できる、機械学習分野で事実上の標準となっているプラットフォームのこと。
AI電力消費とは、AIモデルの学習・推論を担うデータセンターが消費する電力量と、それに伴う電力供給網の制約のことである。
学習データキュレーションとは、AIモデルの学習に使うデータを収集・選別・クレンジングし、品質と多様性を高めて学習に適した状態に整える一連の作業のこと。
RLVRとは、正解が自動判定できるタスクの出力を検証器で採点し、その報酬でLLMを強化学習する手法のこと。
QATとは、推論時に低ビットで量子化することを前提に、学習段階からその誤差を模擬しながらパラメータを調整し、精度劣化を抑えつつ軽量化する量子化認識学習の手法のこと。
エキスパート並列とは、Mixture of Experts(MoE)モデルの各エキスパート(専門家サブネット)を複数のGPUに分散配置し、並列に計算させる分散学習・推論手法のこと。
レート制限とは、一定時間内に受け付けるAPIリクエスト数の上限を定め、過剰なアクセスやサーバー過負荷を防ぐ仕組みのことである。
エポックとは、機械学習の学習プロセスにおいて、訓練データセット全体をモデルに1回すべて通過させる単位のことをいう。
混合精度学習とは、ニューラルネットワークの学習でFP16やBF16などの低精度演算とFP32の高精度演算を使い分け、計算速度とメモリ効率を高める手法のこと。
継続事前学習とは、学習済みの大規模言語モデルに新しいデータで追加の事前学習を行い、知識やドメイン適応力を更新する手法のこと。
データ拡張とは、手持ちの学習データに回転・反転・ノイズ付加などの変換を加えて水増しし、モデルの汎化性能を高める機械学習の前処理手法のこと。
TensorRT-LLMとは、NVIDIA GPU向けに最適化された大規模言語モデル(LLM)推論を高速化するオープンソースの推論エンジンのことである。
液冷とは、GPUサーバーなど発熱の大きい機器を冷却水や特殊液体で直接冷やすAIデータセンターの冷却方式のことで、空冷より高密度な排熱に対応できる。
カリキュラム学習(Curriculum Learning)とは、易しい学習データから徐々に難しいデータへ段階的に難易度を上げて訓練する機械学習の学習戦略のこと。
実験管理(Experiment Tracking)とは、機械学習モデルの学習条件・ハイパーパラメータ・評価指標・成果物を記録し、複数の試行を比較・再現できるようにする運用手法のこと。
中間学習 (Mid-training) とは、 事前学習と 指示チューニングの間に挟む 追加学習フェーズのこと。 推論力や長文処理耐性を強化する目的で行う。
GPTQとは、学習済みの大規模言語モデルの重みを再学習なしで4bit程度まで圧縮する訓練後量子化(PTQ)手法のことである。
DeepSpeedとは、Microsoftが開発した分散学習・推論最適化ライブラリのこと。ZeROというメモリ分割技術で、数十億〜数千億パラメータ規模のモデル学習を可能にする。
特徴量ストアとは、機械学習で使う特徴量(モデルへの入力データ)を一元管理し、学習時と推論時で同じ値を一貫して提供するための基盤のこと。
MLOps(機械学習運用基盤)とは、機械学習モデルの開発から本番投入・監視・再学習までを一連の工程として自動化し継続的に管理する仕組みのこと。
Prefill/Decode分離とは、LLM推論におけるプロンプト処理(Prefill)と逐次生成(Decode)を別々のGPU群に分離して実行する推論アーキテクチャのこと。
バッチAPIとは、大量の推論リクエストを非同期でまとめて処理し、即時応答より低コストを優先するLLM APIの利用方式のこと。
モデルレジストリとは、学習済みモデルのバージョンやメタデータ、評価指標を一元管理し、学習から本番デプロイまでの追跡を可能にする仕組みのことである。
GPU間相互接続とは、複数のGPUをまたいでデータを高速にやり取りするための専用回線のことで、代表例がNVIDIAのNVLinkとネットワーク規格のInfiniBandである。
Rayとは、機械学習の分散学習・並列推論を単一マシンからクラスタへそのままスケールさせるための、UC Berkeley発のOSS分散処理フレームワークのことである。
Rubinとは、NVIDIAがBlackwellの後継として発表した次世代AI向けGPUアーキテクチャのことで、2026年以降のデータセンター投入が予定されている。
ABCI とは、 産業技術総合研究所 (産総研) が構築・運用する 国内最大級の AI 計算基盤 (スーパーコンピュータ) のこと。
FLOPsとは、AIモデルの学習や推論に必要な浮動小数点演算の合計回数を示す指標のこと。モデル規模や学習コストの比較の物差しとして使われる。
コールドスタートとは、休止していたAIモデルが次のリクエストで推論可能な状態に立ち上がるまでに生じる、初回応答の遅延のこと。
Common Crawlとは、インターネット上のWebページを定期的に大規模収集し、誰でも無料で利用できる形で公開しているアーカイブデータおよびその非営利団体のことである。
さくら高火力とは、さくらインターネットが国内データセンターで提供するGPUクラウド基盤のことで、生成AIの学習・推論に使う高性能GPUを従量課金で利用できるサービスを指す。
Tritonとは、Pythonライクな文法でGPU向け高速カーネルを直接記述できるOpenAI発のオープンソース言語のことである。
MN-Coreとは、Preferred Networksが開発したディープラーニングの学習処理に特化した国産AIアクセラレータのこと。
ROCmとは、AMD製GPUでAI計算を行うためのオープンソース計算基盤のこと。NVIDIAのCUDAに対抗する立ち位置にある。
データ並列とは、同じモデルの複製を複数のGPUに配置し、学習データをバッチ単位で分割して各GPUに割り当て並列に処理する分散学習の手法のこと。
AdamWとは、Adam最適化アルゴリズムの重み減衰(weight decay)計算を勾配更新から分離し、過学習を抑えやすくした改良版の最適化手法のこと。
ロススパイクとは、 LLM の事前学習中に 損失値 (loss) が突然跳ね上がり、 学習が不安定化・発散する現象のこと。
語彙拡張 (日本語トークナイザ拡張) とは、 LLM のトークナイザに 日本語特有の専門用語・固有名詞・業界略語を 追加登録し、 不要な分割を減らして 認識精度とトークン効率を高める調整のこと。
Amazon Bedrockとは、Anthropic・Meta・Amazon自社モデルなど複数の基盤モデルをAPI経由でまとめて呼び出せるAWSのマネージド型サービスのこと。
Vertex AIとは、Googleが提供する機械学習モデルの開発・学習・デプロイを一元管理できるクラウド型AI基盤のこと。
Azure AI Foundryとは、MicrosoftがAzure上で提供するAI開発基盤で、モデル選定から開発・評価・運用までを一元管理できることを指す。
エージェント強化学習とは、 AI エージェントが複数ステップの行動 (ツール呼び出し・検索・コード実行) を実際に行い、 その結果得られる報酬信号でモデル自体を継続的に更新する学習手法のこと。
OpenAI互換APIとは、OpenAIのChat Completions API仕様に準拠し、同じリクエスト/レスポンス形式で呼び出せる他社・OSSのLLM APIのこと。
PyTorchとは、Metaが開発したオープンソースの深層学習フレームワークのことで、動的計算グラフにより柔軟なモデル構築ができる点が特徴。
教師強制とは、系列生成モデルの学習時にモデル自身の予測ではなく正解データを次ステップの入力として与える学習手法のことである。
早期終了推論とは、ニューラルネットワークの推論において全層を通さず、途中の層で十分な確信度が得られた時点で計算を打ち切り高速化する手法のこと。
思考連鎖蒸留(CoT Distillation)とは、大規模モデルが生成した思考の連鎖(CoT)を教師データにして、小型モデルへ推論能力を転移学習させる手法のこと。
Slurmとは、GPUクラスタやスーパーコンピュータの計算資源を複数のジョブに割り当てて実行順序を管理する、オープンソースのジョブスケジューラのこと。
データの壁とは、大規模言語モデルの事前学習に使える高品質なテキストデータの供給が有限で、いずれ枯渇するとされる制約のこと。
torch.compile とは PyTorch 2.0 以降に搭載された、 モデルの計算グラフを事前にコンパイルして推論・学習を高速化する最適化機能のこと。
スポットGPUとは、クラウド事業者の余剰GPU容量を通常より大幅に低価格で借りられる代わり、需要増加時は強制的に処理が中断されるプリエンプティブル型の実行方式のこと。
MIGとは、NVIDIAのA100/H100等のGPUを最大7つまでの独立インスタンスに物理分割し、複数のAIワークロードを同時並行で安全に実行できるようにする機能のこと。
法規制・倫理 (145)
カテゴリ単独で見る →EU AI Act / 著作権 / バイアスなど
AI 開発・利用に伴う倫理的問題 (バイアス / プライバシー / 雇用影響 等)。 EU AI Act など規制も進行中。
AI が学習データの偏りを反映して 差別的・偏った出力を生む現象。
EU AI法とは、EUが2024年に成立させた世界初の包括的AI規制法のこと。AIシステムをリスクレベルで4段階に分類し、高リスク用途には厳格な適合義務を課す。
「AI事業者ガイドライン」とは、経済産業省・総務省が2024年に策定した、AI開発・提供・利用事業者向けの行動指針のこと。リスク管理・透明性確保・ガバナンス体制の構築を求める、日本のAI規制における主要な指針である。
ディープフェイクとは、深層学習を用いて実在する人物の顔・声・動作を別の映像や音声に高精度で合成・置換した偽コンテンツのこと。
電子透かしとは、AI生成コンテンツや著作物に人間には知覚されにくい識別情報を埋め込む技術のこと。生成元の特定・著作権保護・フェイクコンテンツ検出に幅広く活用される。
著作権(学習データ著作権)とは、AIモデルの訓練に使用されたコンテンツに対し、元の著作権者が持つ権利のこと。
説明可能なAI(XAI)とは、AIが出した判断や予測の根拠を人間が理解できる形で提示する技術・手法の総称のこと。金融・医療・法務など高リスク分野での信頼性確保や規制対応に不可欠。
C2PA(コンテンツ来歴)とは、デジタルコンテンツの制作者・編集履歴・AI生成有無を暗号署名で証明する業界標準規格のこと。
学習オプトアウト (Opt-out) とは、AIサービスに入力したデータをモデルの再学習・改善に利用されないよう拒否・除外する設定または権利のこと。
NIST AI RMFとは、米NISTが公開したAIリスク管理の国際標準枠組みのこと。AIの開発・運用リスクを体系化する4機能を定義し、各国規制の実務基盤として2026年現在広く参照されている。
GDPRとは、EU域内の個人データ保護を目的とした欧州連合の包括的法規制のこと。違反には最大2,000万ユーロまたは年間全世界売上高4%の高い方が制裁金として科される。
広島AIプロセスとは、2023年のG7広島サミットを契機に設立された、生成AIを対象とする国際的なガバナンス枠組みのこと。透明性・安全性・人権尊重などを柱とする11の指導原則と、AI開発者向け自主行動規範で構成される。
AI推進法とは、日本におけるAI技術の普及促進と安全・信頼性確保を両立させるために制定された法律の総称のこと。EUのAI規制法より産業振興寄りのアプローチが特徴。
AIガバナンスとは、AI システムの開発・運用・利活用において、リスクを管理しつつ倫理的・法的な基準を満たすための組織的な枠組みのこと。
モデルカードとは、AIモデルの用途・学習データ・性能評価・限界・倫理リスクなどを体系的にまとめた、透明性確保のための標準仕様書のこと。
AISIとは、各国政府が設立したAIシステムの安全性を科学的に評価・研究する公的機関のこと。日本では2024年2月にIPA傘下で設置され、大規模AIモデルのリスク評価と安全基準の策定を担う。
汎用目的AI規制(GPAIルール)とは、EU AI法(第V・VI章)に基づき2025年8月から適用された、複数用途に使える大規模AIモデル提供者を対象とした義務付け規則のこと。
ISO/IEC 42001とはAIマネジメントシステム(AIMS)の国際規格のこと。AIの開発・提供・利用を行う組織が責任あるガバナンス体制を構築・維持・改善するための枠組みを定める。
ソブリンAIとは、データ・モデル・計算基盤を特定の国家や組織の管轄内に完結させ、外部プロバイダーに依存せず自律的にAIを運用・管理する考え方のこと。
AI影響評価とは、AIシステムが社会・個人に与えるリスクや影響を、開発・導入の前後に体系的に分析・文書化するプロセスのこと。
人間中心のAI社会原則とは、内閣府が2019年に策定した、AI開発・利活用における基本的な考え方を定めた国内ガイドラインのこと。
透明性義務とはAIシステムの開発者・事業者が、システムの仕組みや判断根拠をユーザーや規制当局に開示する法的・倫理的義務のこと。
データガバナンスとは、組織内のデータの品質・セキュリティ・利活用ルールを一元的に定め、ライフサイクル全体を管理する体制やプロセス全般のこと。
AI責任とはAIシステムが引き起こした損害・誤情報・差別的判断について、開発者・運営者・利用者のいずれが法的・倫理的責任を負うかを定める概念のこと。
個人情報保護法 (APPI) とは、個人情報の収集・利用・提供・管理に関するルールを定めた日本の基本法のこと。2022年改正で罰則強化・越境移転規制が大幅に拡充され、AI活用企業が必ず遵守すべき法的基盤となっている。
フロンティアAI安全性コミットメントとは、OpenAI・Anthropic・Googleなどの先端AI企業が各国政府に対して約束する、AI安全開発の自主的な合意枠組みのこと。
著作権法30条の4とは、著作物を情報解析目的で利用する場合に著作権者の許諾が不要と定めた日本独自の規定のこと。
フェアユースとは、著作権で保護されたコンテンツを権利者の許可なく一定条件下で合法的に利用できる米国著作権法上の法理のこと。
AI監査とはAIシステムの信頼性・公平性・透明性・法令遵守を、第三者または内部チームが体系的に評価・検証するプロセスのこと。
肖像権・パブリシティ権とは、人物の顔・姿・声などの特徴を本人の同意なく商業利用・複製されない権利のこと。AI画像生成ツールの普及により侵害リスクが急増している。
偽情報・誤情報(Disinformation)とは、意図的または非意図的に作成・拡散される虚偽の情報のことで、AI生成コンテンツの急増により企業・社会が直面する深刻なリスク領域のこと。
AI生成物の著作物性とは、生成AIが作った文章・画像・音声などが著作権法上の「著作物」として保護されるかどうかを判断する論点のこと。
TDM例外とは、著作権法上、AIの学習やテキスト・データマイニングのために著作物を利用する際に著作権者の許諾を原則不要とする規定のこと。
コロラドAI法とは、雇用や与信などの重要な判断にAIを使う企業に、差別防止のためのリスク評価と説明責任を義務付ける米国コロラド州の州法のこと。
AI表示義務とは、AIが生成・編集したコンテンツやAIとのやり取りであることを利用者に明示するよう求める法規制・ガイドラインの総称のことである。
高リスクAI(High-Risk AI System)とは、医療診断や採用選考、信用スコアリングなど人の安全や権利に重大な影響を与えうる用途で使われるAIシステムのことである。
テキサスAI法(TRAIGA)とは、2026年1月1日施行の米テキサス州AI規制法で、行動操作・差別・違法ディープフェイクなど「意図的な悪用」を対象にAI開発者・提供者へ罰則を科す枠組みのこと。
生成AIパスポートとは、ビジネスにおける生成AIの正しい活用知識とリスク管理・倫理的配慮を測定する民間資格試験のこと。
規制サンドボックスとは、新技術やサービスを既存規制の一部を緩和・凍結した限定環境で試験的に運用できる制度のことです。
EU AI事務局とは、EU AI法の実施・監督・執行を担うため欧州委員会内に設置された専門組織のこと。汎用AI(GPAI)モデルの規制を主導する。
GPAI行動規範とは、EU AI法が定める汎用AI(GPAI)モデル提供者の義務を、透明性・著作権・安全性の3分野で具体化した自主的な行動規範のこと。
システミックリスク(GPAI)とは、演算能力や利用規模の大きさから社会全体に重大な影響を及ぼしうると判定された汎用目的AIモデルに、EU AI法が追加の義務を課す分類区分のこと。
学習データ開示義務とは、AIモデルの開発事業者が学習に使用したデータの種類・出所・著作権処理状況を開示することを求める規制上の考え方のこと。
デジタルサービス法(DSA)とは、EUが2022年に採択した、オンラインプラットフォーム事業者に違法コンテンツ対応や広告の透明性確保などを義務付ける規制法のこと。
バイアス監査義務とは、採用選考でAIツールを使う企業に、差別的判定がないか独立監査人に年1回検証させ結果を公開させる規制のことで、ニューヨーク市のLocal Law 144が代表例とされる。
禁止AI慣行とは、EU AI法第5条が定める、社会的に許容できないリスクゆえに提供・使用自体を禁じる8種類のAI用途のこと。
基本的権利影響評価(FRIA)とは、EU AI法が高リスクAIシステムの導入前に個人の権利への影響を評価するよう一部の運用者に義務付ける手続きのこと。
適合性評価とは、AIシステムが法規制や業界標準が定める要件(安全性・リスク管理・透明性など)を満たしているかを審査・確認するプロセスのこと。
中国生成AI規制(暫定弁法)とは、中国政府が2023年8月に施行した、生成AIサービスの提供者に安全評価・アルゴリズム登録・利用者の実名確認などを義務付ける行政規則のこと。
AI Pactとは、EU AI法の本格施行前に企業がAIガバナンス原則を自主的に遵守すると欧州委員会に誓約する任意の枠組みのこと。
文化庁「AIと著作権に関する考え方」とは、生成AIの学習・生成の各段階における著作権法上の論点を文化庁が2024年に整理した見解文書のこと。
AI基本計画とは、2025年12月に閣議決定された、AI法(AI推進法)に基づく日本初の法定AI国家戦略計画のこと。
生成AI利用ガイドラインとは、企業が従業員の生成AI利用について、入力禁止情報・承認フロー・著作権確認などのルールを定めた社内規程のこと。
モデルライセンスとは、AI企業が公開する学習済みモデルの利用条件を定めた規約のことで、商用利用の可否や改変・再配布の範囲を規定する。
米国AI大統領令とは、米国大統領が議会審議を経ずにAI政策の方向性を示す大統領令(Executive Order)の総称のこと。
NO FAKES法とは、本人の同意なしにAIで声や容姿を模倣したデジタル複製(デジタルレプリカ)を作成・公開することを規制する米国の連邦法案のこと。
機械学習消去とは、学習済みのAIモデルから特定の個人データや不要なデータの影響を、モデル全体を再学習せずに除去する技術のこと。
自動意思決定規制(Automated Decision-Making)とは、AIが人の関与なく与信審査や採用選考など重要な判断を行うことに、説明責任や人間の確認を義務付ける規制の考え方のことである。
EU製造物責任指令(改正PLD)とは、AIソフトウェアや部品を含む欠陥製品がもたらした損害についてメーカーに厳格責任を課す、2024年改正のEU指令のこと。
カリフォルニアSB53(フロンティアAI透明法)とは、大規模AIモデルを開発する企業に安全フレームワークの公表や重大インシデントの報告を義務づける、2025年成立のカリフォルニア州法のこと。
Take It Down Actとは、本人の同意なく作成・拡散された性的なディープフェイク画像・動画の削除をプラットフォームに義務付ける、2025年成立の米国連邦法のこと。
ELVIS Act(声・肖像保護法)とは、AIによる音声クローンや肖像の無断利用から個人の声・肖像を守るため、2024年に米テネシー州で成立した州法のこと。
欧州評議会AI枠組条約とは、AIの開発・利用における人権・民主主義・法の支配への影響を規律する、法的拘束力を持つ世界初の国際AI条約のこと。
忘れられる権利とは、本人が自身に関する個人データの削除を事業者に求められる権利のこと。
AI著作権訴訟とは、生成AIの学習データ利用やAIが生成した成果物の著作権侵害を巡り、著作権者やクリエイターがAI開発企業を訴える一連の法的紛争のことである。
AI発明者性とは、AIが生み出した発明についてAIを法律上の発明者と認めるかどうかを巡る論点のこと。
AIと子どもの安全(年齢確認)とは、生成AIサービスが未成年者を有害情報や不適切な対話から守るため、年齢確認や保護者同意の仕組みを組み込む取り組みのこと。
AIと名誉毀損とは、生成AIが事実と異なる人物や企業の情報をもっともらしく生成・拡散し、名誉権侵害や誤情報の法的責任が問われる問題のこと。
顔認識規制とは、AIによる顔画像の収集・照合・利用を法律や条例で制限し、プライバシーや誤認識のリスクから個人を守るための枠組みのこと。
OECD AI原則とは、2019年にOECDが採択したAI開発・運用の国際指針で、人間中心の価値観や透明性、説明責任などを定めた原則群のことである。
AI安全サミットとは、各国政府・企業・研究者が生成AIのリスク管理や国際協調のルール作りを話し合う国際会議のことである。
国際AI安全性報告書とは、各国政府が推薦した研究者らが最先端AIの能力とリスクを科学的知見に基づき整理する国際的な報告書のこと。
感情認識規制とは、表情や音声、生体信号などからAIが感情を推定・分析する技術の利用を、プライバシー侵害や誤判定のリスクを理由に法律や社内規程で制限する取り組みのこと。
デンマークAI肖像保護法とは、AIによる本人そっくりのディープフェイク映像・音声から個人の顔・声・容姿を守るため、著作権法改正で導入が進められているデンマークの法律のこと。
AI透明性レポートとは、企業が自社のAIシステムの学習データ・判断基準・リスク対策を開示する報告書のこと。
職場AI監視規制とは、企業がAIを用いて従業員の業務パフォーマンスや行動を監視・評価する際に課される情報開示・同意取得などの法的義務のことである。
AI倫理委員会とは、AIの開発・運用に伴う倫理的リスクを審査し、ガイドライン策定や利用可否の判断を行う社内外の合議体のこと。
AI半導体輸出規制とは、高性能GPUなど先端AI半導体の輸出入を安全保障上の理由で政府が制限する規制のことで、米国による対中措置が代表例である。
AI医療機器規制(SaMD)とは、診断支援や画像解析などにAIを組み込んだソフトウェアを医療機器として扱い、有効性と安全性を審査・監視する法規制の枠組みのこと。
ステマ規制とは、事業者が広告であることを隠して行う表示を景品表示法上の不当表示として取り締まる制度のこと。2023年10月に日本で施行された。
AIと労働法とは、AIによる採用選考・勤怠管理・業務指示・解雇判断などの労働場面で生じる法的責任やルールを扱う分野のこと。
韓国AI基本法とは、AI技術の発展支援と利用者保護を両立させるため韓国で制定された包括的なAI規制法のことで、2026年1月に施行される。
デジタルオムニバスとは、EU AI法における高リスクAIシステムの義務適用時期を先送りし、文書化要件を簡素化する欧州委員会の一括改正案のこと。
米国AIアクションプランとは、2025年7月に米政権が発表したAI国家戦略「Winning the Race: America's AI Action Plan」のことで、AI開発の規制緩和・データセンター等インフラ整備・国際的な技術覇権確保を三本柱とする方針文書のこと。
教育の生成AI利用ガイドライン(文科省)とは、文部科学省が学校現場向けに示した生成AIの活用可否や留意点をまとめた指針のこと。
AI・データ契約ガイドラインとは、経済産業省がAI開発とデータ利用における契約上の論点を整理し、モデル契約書のひな形とともに公表している指針のことである。
SynthIDとは、Google DeepMindが開発した、AI生成画像・音声・動画に知覚できない電子透かしを埋め込み、生成物と検出できるようにする技術のことである。
類似性・依拠性とは、著作権侵害の成否を判断する2つの法的基準で、既存著作物との表現の共通性と、それに基づいて創作したかを指す。
コンテンツライセンス契約とは、AI企業が報道機関や出版社などの著作権者からコンテンツの学習利用許諾を得て、対価を支払う契約のこと。
選挙とAI規制とは、選挙運動でのAI生成コンテンツ(ディープフェイク動画・合成音声・自動投稿)の利用を制限し、情報開示を義務付ける各国のルールのこと。
AIクローラ制御(GPTBotブロック)とは、GPTBotやClaudeBotなどAI学習・検索用クローラーの自サイトへのアクセスを、robots.txtやWAF設定で許可・拒否する仕組みのこと。
著作権法47条の5とは、検索エンジンやAIによる情報解析サービスなどが、結果提供に付随して著作物を軽微に利用する行為を著作権者の許諾なく認める規定のこと。
不正競争防止法とは、営業秘密の不正な取得・使用・開示などを禁止し、企業の競争上の利益を保護する法律のこと。AI開発では学習データや生成物への営業秘密混入が新たな論点となっている。
金融分野のAI利用ガイドラインとは、金融庁や金融業界団体が示す、与信審査・資産運用・顧客対応などにAIを活用する際の説明責任やリスク管理に関する指針のこと。
No-Train条項とは、ユーザーが入力したデータや生成AIの出力結果を、事業者がモデルの追加学習に利用しないことを契約や規約で保証する条項のこと。
域外適用とは、ある国や地域の法律・規制が、その国の領域外で活動する外国企業や国外拠点の事業者にも及ぶ法理論のこと。
自治体AI利用ガイドラインとは、地方自治体が生成AIを業務で活用する際の利用範囲・禁止事項・個人情報の取り扱いルールを定めた内部規程のことである。
システムカードとは、AIモデルの能力・限界・安全性評価・既知のリスクをまとめて開発元が公開する技術文書のことである。
景品表示法(AI生成広告の優良誤認)とは、AIが自動生成した広告表現が実際の性能や効果よりも著しく優良であると消費者に誤認させる表示を景品表示法違反として規制する概念のこと。
弁護士法72条とは、弁護士でない者が報酬目的で法律事務を取り扱うことを禁じる規定のことで、リーガルAIサービスの設計範囲を左右する。
出力の権利帰属とは、生成AIが作った文章・画像・動画などの著作物について、著作権や商用利用権が誰に帰属するかを定めた考え方のこと。
重大インシデント報告義務とは、EU AI法で高リスクAIシステムの提供者に課される、深刻な事故や機能不全を規制当局へ一定期限内に報告する義務のこと。
個人データの越境移転規制とは、個人情報を国境を越えて第三国へ移転する際に本人同意や十分性認定などの法的要件を課す規制のことである。
商標権とは、企業名・商品名・ロゴマークなど、事業者が自他商品を識別するために使う標章を独占的に使用できる権利のこと。AI生成ロゴが既存商標に類似すると侵害リスクが生じる。
論文のAI利用開示とは、研究論文の執筆・データ分析・翻訳などでAIツールを使った場合に、使用範囲や方法を学術誌・学会の規定に沿って明記する研究倫理上のルールのこと。
外部送信規律とは、電気通信事業法27条の12に基づき、Webサイトやアプリがユーザーの通信情報を外部に送信する際に通知・公表または同意取得を義務づける規律のこと。
AI保険とは、AIシステムの誤作動や判断ミスに起因する損害賠償責任や事業中断損失を補償する保険商品のこと。
リスクベースアプローチとは、AIシステムがもたらすリスクの大きさに応じて規制や対応の強度を段階的に変える考え方のこと。
情プラ法とは、大規模なオンラインプラットフォーム事業者に権利侵害情報の削除申出対応や体制公表を義務付ける法律のこと。
デジタル庁 テキスト生成AI利活用ガイドラインとは、行政機関がChatGPTのようなテキスト生成AIを政府情報システムへ導入・運用する際のリスクと軽減策を整理した公式文書のこと。
生成コードのライセンス混入とは、AIが生成したコードにGPLなど互換性のないOSSライセンスのコードが意図せず含まれてしまう問題のこと。
作風模倣とは、特定の作家や作品の画風・文体・音楽性などの表現スタイルをAIで学習・再現する技術や生成物のことである。
商用安全モデルとは、著作権侵害や機密情報漏洩のリスクを抑えるよう学習データや利用規約が設計されたAIモデルのこと。企業向けに提供元が法的補償を付ける場合もある。
州AI法の連邦優先(プリエンプション)とは、連邦のAI関連法が成立した際に、その規定が州ごとのAI規制条例の効力を無効化・制限する仕組みのこと。
AIエージェントの代理権(法的地位)とは、AIが自律的に行った契約締結や意思表示の法的効果を、誰にどこまで帰属させるかを定める法律上の枠組みのこと。
アルゴリズム価格協調とは、複数事業者のAI価格設定ツールが明示的な合意なしに同調的な値上げ・価格維持行動をとってしまい、独占禁止法のカルテル規制に抵触しうる状態のこと。
AI楽曲の著作権管理(JASRAC登録)とは、AIで生成した楽曲について著作権の発生要件を満たすか判断し、JASRACなど管理団体への登録可否を整理する実務のこと。
意匠権とは、工業製品や画像のデザイン(形状・模様・色彩など)を独占的に利用できる知的財産権のことで、AI生成デザインも登録要件を満たせば保護対象になり得る。
海賊版学習データとは、著作権者の許諾を得ずに収集・複製された著作物をAIモデルの学習データとして無断使用したものを指す。
EU AI法の制裁金とは、AI法(EU AI Act)の禁止事項や高リスクAI規制などに違反した事業者に科される行政制裁金のことで、違反の重大性に応じて最大7%までの売上高比率で算定される。
プラットフォームのAI生成表示義務とは、SNSや動画共有サービスなどが、AIで生成・加工したコンテンツに対しユーザーへの明示的なラベル表示を求める規制・自主規制上の義務のこと。
要配慮個人情報とは、人種・信条・病歴・犯罪歴など、本人への不当な差別・偏見その他の不利益が生じないよう特に慎重な取扱いを要すると個人情報保護法が定める情報のこと。
声の権利とは、声優やナレーターの声をAIが本人の同意なく学習・合成し、酷似した音声を生成・利用できてしまう問題のこと。
英国のAI規制方針(親イノベーション型)とは、新たな専用規制機関を作らず既存の分野別規制当局が5原則を運用する英国のAI規制アプローチのこと。
電子帳簿保存法とは、国税関係の帳簿・書類を電子データで保存する際のルールを定めた法律で、AI-OCRによるスキャナ保存要件も含むもののこと。
利用ポリシー(AUP)とは、AIベンダーが自社サービスで許可しない用途や行為を定めた規約のこと。違反するとアカウント停止につながる。
提供者・利用者の責務区分とは、AIシステムを開発・市場投入する「提供者(Provider)」と、業務で実際に運用する「利用者(Deployer)」に異なる法的義務を課すAI規制上の枠組みのこと。
ISO/IEC 23894とは、AIシステム特有のリスク特定・評価・対応の進め方を示す国際規格のことである。
著作権法35条とは、学校等の教育機関が授業の過程で使用する目的に限り、著作物を許諾なく複製・公衆送信できると定めた著作権法上の権利制限規定のこと。
TDM留保表明(TDMRep)とは、著作権者がテキスト・データマイニング(AI学習等)への自コンテンツ利用を拒否する意思を、機械可読形式でサイトに掲示する国際的な仕組みのことである。
EU AI法の段階施行とは、EU AI法がリスクの高さに応じて禁止規定・GPAI規定・高リスク規定を異なる期日で順次適用させる制度のことである。
イタリアAI法とは、2025年9月にイタリアで成立したEU加盟国初のAI関連国内法(法律132号)のこと。
カリフォルニアSB243とは、AIコンパニオンチャットボット事業者にAIである旨の開示や自殺念慮への対応プロトコルを義務付ける、2026年1月施行のカリフォルニア州法のこと。
基盤モデルと競争政策(独禁法)とは、少数の大規模基盤モデル提供企業への市場集中が、公正な競争や新規参入を阻害しないよう規制当局が監視・介入する政策領域のことをいう。
AI学習の対価還元(報酬請求権)とは、著作物やデータをAIモデルの学習に用いた際、権利者が対価の支払いを求められる権利・制度のことである。
証拠の真正性とは、写真や動画などのデジタル証拠がAIによる生成・改変を受けていないと技術的に証明できる性質のことである。
AIデューデリジェンスとは、M&Aの買収監査でAIモデルやデータ資産の権利関係・法規制リスク・技術的負債を精査するプロセスのこと。
特定電子メール法とは、広告・宣伝目的の電子メールを送信する際に受信者の事前同意(オプトイン)や送信者情報の表示、配信停止手段の設置を義務付ける日本の法律のこと。
匿名加工情報とは、個人情報保護法に基づき特定の個人を再識別できないよう加工した情報のことで、本人同意なしに第三者提供や統計分析に利用できる。
個人データの委託とは、自社が定めた利用目的の範囲内で、第三者に個人データの取り扱いを任せることのこと。第三者提供と異なり本人同意が原則不要とされる点が特徴である。
中小受託取引適正化法(改正下請法)とは、親事業者による代金の一方的決定や支払遅延を禁じ、価格転嫁交渉を義務付けた、2026年1月施行の下請法改称・強化法のこと。
EU AIシステム登録データベースとは、EU AI法(AI Act)第71条に基づき欧州委員会が運営する、高リスクAIシステムの提供者情報を登録・公開する公的データベースのこと。
ダークパターン規制とは、ユーザーの意思決定を歪めて不利益な選択に誘導するUI設計を法的に禁止・制限する動きのこと。
Webスクレイピングの適法性とは、ウェブサイトの情報を自動収集する行為が著作権法・利用規約・不正アクセス禁止法に抵触しないかを判断する論点のこと。
ビジネス応用 (106)
カテゴリ単独で見る →業務自動化 / SaaS統合 / DX
AI + ノーコードツール (Zapier / Make / n8n) で 繰り返し業務を自動実行する仕組み。
AI がコード補完 / 生成 / レビューを行う開発手法。 Cursor / GitHub Copilot / Windsurf が代表。
AI ネイティブな コードエディタ。 Composer + Agent で AI が自律的にコード生成。
GitHub 提供の AI コード補完。 月 $10、 VS Code / JetBrains / Neovim で動く。
Notion 統合の AI 機能。 月 $10、 ドキュメント要約 / 翻訳 / 議事録整理が Notion 内で完結する。
業務自動化のノーコードツール最大手。 7,000+ アプリ連携、 AI 機能内蔵で 月 $19.99〜。
Generative Engine Optimization。 AI 検索で引用されやすいコンテンツ作成の SEO 次世代版。
DeepL / Google 翻訳 / Claude / ChatGPT による 機械翻訳。 ビジネス文書なら DeepL、 文脈は LLM が強い。
バイブコーディングとは、コードの詳細を深く理解せずAIに自然言語で意図を伝え、生成されたコードを感覚的に受け入れながら開発を進めるプログラミングスタイルのこと。
Devinとは、Cognition AIが開発した自律型AIソフトウェアエンジニアのこと。コードの設計・実装・デバッグ・テストをエンジニアの指示なしに一気通貫で実行できる。
Dify(ディファイ)とはオープンソースの LLM アプリケーション開発プラットフォームのこと。コーディング不要でチャットボットや RAG パイプライン、AI エージェントをビジュアルに構築・デプロイできる。
DXとはデジタル技術を活用してビジネスモデル・業務プロセス・組織文化を根本から変革し、競争上の優位性を確立すること。単なるIT化や効率化とは区別される。
v0 (UI生成ツール)とはVercelが提供する、テキストや画像の指示からReact/Next.js対応のUIコンポーネントを自動生成するAIコーディングツールのこと。
AI内製化とは、外部ベンダーに頼らず自社でAIシステムの企画・開発・運用を一貫して担うことを指す。コスト削減とノウハウ蓄積が主目的だが、保守人材の確保が最大のボトルネックとなる。
AIリテラシーとは、AIツールの仕組みを理解し、業務で適切に活用・評価・判断できる知識とスキルの総称のこと。
AIネイティブとは、AIを後付けで導入するのではなく、設計・開発・運用の最初からAIを前提として構築されたサービスや組織のこと。
ローカルLLMとは、クラウドAPIに依存せず、自社サーバーや個人PCなどのローカル環境で直接動作させる大規模言語モデルのこと。データが外部に出ないためプライバシー保護に優れる。
RPAとは、人間がPCで行うクリックや入力などの反復作業をソフトウェアロボットが代わりに自動実行する技術のこと。コードを書かずに定型業務を自動化できる。
AI議事録とは、会議の音声や映像をAIが自動で文字起こし・要約し、アクションアイテムまで抽出する技術のこと。
Gammaとはテキストプロンプトを入力するだけでスライド・ドキュメント・Webページを自動生成できるAIプレゼン作成ツールのこと。
ノーコードAIとはコードを書かずにGUI操作だけでAI機能の構築・自動化・業務組み込みができるツールや開発環境のこと。
AI PoCとは、AI導入前に小規模な試作・検証を行い、実現可能性とビジネス効果を確認するプロセスのこと。
バーティカルAI(業界特化AI)とは、法務・医療・金融など特定業界の業務知識に特化して設計されたAIモデルやサービスのことである。
PoC疲れとは、AIのPoC(概念実証)を何度繰り返しても本番導入や投資対効果の証明に至らず、現場や経営層が検証自体に消極的になる状態のことである。
AI CoE(AI推進組織)とは、全社のAI活用を横断的に統括し、導入基準や活用ノウハウを整備する専門組織のことである。
Clineとは、VS Code拡張機能として動作し、AIが自律的にファイル編集・コマンド実行・デバッグまで行うオープンソースのAIコーディングエージェントのこと。
Feloとは、複数の検索エンジンとAIモデルを組み合わせ、出典付きの要約回答を返すAI検索エンジンのことで、深掘りリサーチやマインドマップ生成機能を備える。
Gensparkとは、検索クエリに応じてAIが要約ページを自動生成し、複数ステップの作業を代行する自律型AIエージェント機能も備えたプラットフォームのこと。
シチズンデベロッパーとは、専門のプログラミング知識を持たない業務部門の担当者が、ノーコード・ローコードツールやAIを使い自ら業務アプリや自動化を作る人材のこと。
エージェンティックコマースとは、AIエージェントが商品の検索・比較・注文・決済までをユーザーに代わって自律的に実行する購買モデルのこと。
Sakana AIとは、進化的アルゴリズムで複数のAIモデルを自動的に組み合わせて最適化する「進化的モデルマージ」を軸とする、東京拠点のAIスタートアップのことである。
デジタルワーカーとは、AIエージェントが人間の従業員のように定型業務やワークフローを自律的に実行する仕組みのこと。
成果報酬型AI課金とは、AIサービスの利用料金を稼働時間やAPI呼び出し回数ではなく、実際に生み出した成果(売上増・コスト削減・解決件数など)に連動して請求する課金モデルのこと。
Lovableとは、チャット形式のプロンプト入力だけでWebアプリのUIとバックエンドを自動生成し、公開まで行えるAIアプリ開発プラットフォームのこと。
AI成熟度モデルとは、組織におけるAI活用の進展度合いを、導入初期から全社的な自律運用まで複数段階で評価するフレームワークのこと。
Service-as-Softwareとは、AIエージェントが人間の代わりに業務タスクを実行し、成果に応じて課金するビジネスモデルのこと。
AI駆動開発とは、AIエージェントが要件定義・コード生成・テスト・レビューまで開発工程の主要部分を担い、人間は設計判断と最終承認に専念する開発手法のこと。
Microsoft 365 Copilotとは、Word・Excel・PowerPoint・OutlookなどMicrosoft 365アプリに組み込まれた生成AIアシスタント機能のこと。
AIカスタマーサポートとは、生成AIやチャットボットがFAQ・過去履歴をもとに顧客からの問い合わせへ自動応答し、有人対応の負荷を軽減する仕組みのこと。
IT導入補助金とは、中小企業・小規模事業者がITツールやAIサービスを導入する際の費用の一部について国から補助を受けられる公的制度のこと。
AI SDRとは、見込み客の発掘からアプローチメール送付、一次架電まで、SDR(営業開発担当)が担う業務をAIが代行・自動化するツールやサービスのことである。
Gleanとは、社内のドキュメントやチャット、SaaSに散在する情報を横断検索し、生成AIが要約・回答するエンタープライズ検索プラットフォームのこと。
AI FinOpsとは、AI/LLM利用にかかるクラウド・API費用を継続的に可視化し、予算超過を防ぎながら支出を最適配分する運用手法のこと。
Agentforceとは、Salesforceが提供する、CRMデータをもとに顧客対応や営業活動を自律的に遂行するAIエージェントを構築・運用できるプラットフォームのこと。
Windsurfとは、AIエージェントがコードベース全体を把握しながら複数ファイルの編集や修正を自律的に進められる、AIコーディング特化型のIDEのこと。
AIリスキリングとは、既存の従業員がAI活用スキルを新たに習得し、業務内容や役割を再構築することで生産性や事業価値の向上を目指す取り組みのこと。
AI定着率とは、導入した生成AIツールやAIエージェントが一時的な試用で終わらず、組織の日常業務に組み込まれて継続的に使われ続けている度合いを示す指標のこと。
エージェントマーケットプレイスとは、企業や開発者が作成したAIエージェントを一覧公開し、他の企業が検索・比較して導入できるオンラインの流通の場のこと。
Bolt(ボルト)とは、自然言語のプロンプトだけでフロントエンドからバックエンドまで含むWebアプリをブラウザ上で自動生成し、その場で編集・プレビューできるAIアプリ生成ツールのこと。
Replit Agentとは、自然言語の指示だけでアプリの設計・コーディング・デプロイまでを自動で行うAIコーディングエージェントのこと。
Harveyとは、OpenAIの技術基盤を用いて契約レビューや判例調査、訴訟資料作成など法律実務を支援する企業向けAIアシスタントのこと。
AIチャンピオンとは、社内でAI活用を主導し、各部署への定着や活用文化の醸成を担う推進担当者のことである。
エージェント経済圏とは、AIエージェント同士や人間とAIエージェントが自律的にタスクを依頼・実行・決済し合う経済活動の広がりのこと。
Sierra(シエラ)とは、米国のスタートアップが開発した、企業のコールセンター電話対応やチャットサポートを代行する会話型AIエージェントのプラットフォームのこと。
AI投資対効果(AI ROI)とは、AI導入にかかったコストに対して得られた成果(コスト削減・売上増・生産性向上など)を金額換算し、費用対効果を測る指標のこと。
エージェント型BPOとは、AIエージェントが受発注・問い合わせ対応・経理処理などの定型業務を自律的に遂行し、人間は例外対応と品質監督に専念する新しいアウトソーシング形態のこと。
Chief AI Officer(最高AI責任者)とは、企業全体のAI導入戦略・ガバナンス・投資対効果の管理を統括する経営幹部のポジションのこと。
AIラッパーとは、OpenAIのGPTやAnthropicのClaudeなど既存の大規模言語モデルAPIに独自のUIやプロンプト設計を重ねて提供するアプリケーションのこと。
AIバブルとは、生成AI関連企業への投資や期待が実態の収益力を超えて過熱し、いずれ調整局面を迎えるとされる市場全体の状態のこと。
業務プロセス再設計(BPR)とは、既存の業務フローや組織構造を根本から見直し、ITやAIを活用して抜本的に再構築する経営改革の手法のこと。
AIツールスプロール (ツール乱立) とは、 部署やチームが 全社調整なしにAIツールを個別導入し続けた結果、 契約・アカウント・データが分散し 管理不能に陥る状態のこと。
AIチェンジマネジメント(定着支援)とは、生成AIツールやAIエージェントを導入した組織で、現場の抵抗感や運用習慣の壁を乗り越え、実際の業務に根付かせるための計画的な変革管理のこと。
会話型BIとは、SQLやダッシュボード操作を使わず、自然言語の質問だけでBIツールがデータを集計・可視化して回答してくれる仕組みのこと。
コンテンツリパーパスとは、1つの元コンテンツを要約・切り抜き・スライドなど別形式に加工し、複数のチャネルへ再展開する手法のこと。
クレジット課金とは、AIサービスの利用量に応じて消費する仮想通貨的な「クレジット」を購入・消費する従量課金方式のこと。
AI経由流入とは、ChatGPTやPerplexityなどのAIチャットボット・AI検索エンジンの回答内でサイトが引用・言及されることで発生する訪問トラフィックのこと。
AIレディネスとは、組織が保有するデータやシステムがAI導入に耐えうる整備状態にあるかを示す指標のこと。
G検定・E資格とは、日本ディープラーニング協会(JDLA)が実施する、AI・ディープラーニングの知識(G検定)と実装スキル(E資格)を認定する資格のこと。
AI人材不足とは、AIの企画・開発・運用を担える人材の需要に採用や育成が追いつかず、現場での導入が停滞する状態のこと。
ChatGPTアプリ(Apps SDK)とは、開発者が自社サービスをChatGPTの会話内で直接操作できるミニアプリとして組み込むためのOpenAI公式フレームワークのこと。
ベンダーロックインとは 特定の AI ベンダーの API やモデル仕様に業務フローを深く依存させた結果、 他社への乗り換えが困難になる状態のこと。
AIコンパニオンとは、雑談や相談の相手役を担い、継続的な対話を通じて心理的なつながりを提供するよう設計された対話特化型AIアプリのこと。
大量生成コンテンツの不正使用とは、検索順位を操作する目的で、AIか人力かを問わず品質を担保しないまま大量のページを量産する行為をGoogleがスパムポリシー違反と定義したものである。
生成AI研修とは、企業が従業員に生成AIの安全かつ効果的な業務活用を身につけさせる社内教育プログラムのこと。
AI採用(HR Tech)とは、書類選考・適性検査・面接評価などの採用プロセスにAIを活用し、候補者の絞り込みや評価業務を効率化する手法のこと。
デジタルツインとは、現実の設備・工場・都市などの物理的な対象をセンサーデータで仮想空間上に再現し、シミュレーションや予測に活用する技術のこと。
AI需要予測とは、過去の販売実績や季節性、天候・イベントなどの外部要因を機械学習モデルに学習させ、将来の商品需要量を予測する技術のことである。
推論原価とは、AIモデルが応答を1回生成するたびに発生するトークン処理・GPU利用料等の計算コストを指す、AIサービスの原価管理指標のこと。
llms.txtとは、AIクローラーがサイト内容を把握しやすいよう、構成や要点をテキストでまとめて示すウェブサイト向け標準のこと。
E-E-A-T とは Experience・Expertise・Authoritativeness・Trustworthiness の頭文字で、 検索エンジンがコンテンツの質を評価する指針のこと。
ホワイトラベルAIとは、他社が開発したAI機能を自社ブランドの製品として再販・提供できるOEM形態のサービスのことである。
法人向けLLM契約とは、企業がChatGPTやClaudeなどのLLMをユーザー数(seat)単位で契約し、SSOや非学習保証などの管理機能を得られる料金プランのこと。
データアノテーションとは、AIモデルの学習に使う画像・テキスト・音声データに、正解ラベルや注釈を人手で付与する作業のこと。
バイブワーキングとは、資料作成や分析などの業務をAIエージェントに自然言語で指示し、細部を精査せず成果物の完成度で判断しながら仕事を進める働き方のこと。
プロセスマイニングとは、業務システムのログデータから実際の業務プロセスの流れを自動的に可視化し、非効率や逸脱を発見する分析手法のこと。
DORA指標とは、デプロイ頻度・変更のリードタイム・変更失敗率・サービス復元時間の4つでソフトウェア開発チームの生産性と安定性を測る業界標準の枠組みのこと。
予知保全とは、設備の稼働データをAIで分析し、故障の兆候を事前に検知して点検・部品交換の時期を最適化する保全手法のこと。
AI家庭教師(AI Tutor)とは、生成AIが対話形式で学習者の理解度に合わせて解説・演習・フィードバックを行う個別指導サービスのこと。
AI不正検知とは、機械学習モデルが取引データや行動ログの異常パターンをスコアリングし、不正利用や詐欺の疑いがある取引を自動で検出する仕組みのこと。
契約書レビューAIとは、AIが契約書の条文を解析し、不利な条項や抜け漏れをリスク付きで自動検出し、修正案まで提示するサービスのこと。
少人数AI企業(Tiny Team)とは、創業者本人または数名程度の体制で、AIエージェントや自動化ツールを業務の中核に据え、少人数のまま高い売上規模を目指す事業形態のこと。
ダイナミックプライシングとは、需要・在庫・競合価格などの変動要因をAIがリアルタイムに分析し、商品やサービスの価格を自動で変動させる仕組みのこと。
バイブマーケティングとは、生成AIエージェントで広告やコンテンツ案を高速に量産し、勢いと直感を重視した試行錯誤で成果を探るマーケティング手法のこと。
AIOpsとは、AIと機械学習を活用してIT運用の監視・異常検知・原因分析・復旧対応を自動化する手法のこと。
社内AIチャット基盤(Private ChatGPT)とは、社外へのデータ送信を遮断し自社の情報基盤内だけでAIチャットを利用できる企業向け仕組みのこと。
AIサービスのSLAとは、稼働率や応答時間、精度などの品質水準をベンダーが数値目標として契約上保証する取り決めのことである。
AI導入のRFP・ベンダー選定とは、企業がAIツールやサービスを導入する際に要件を文書化し、複数ベンダーを比較評価して選ぶ調達プロセスのこと。
AIによる労働代替とは、これまで人が担っていた定型業務や判断業務をAIが代行し、人員配置や採用計画そのものを置き換える動きのことをいう。
フォワードデプロイドエンジニアとは、顧客先に常駐してAIソフトウェアの導入から実装まで一貫して担うエンジニア職のこと。
Google Zeroとは、生成AIの回答表示によって検索結果からのクリックがほぼ消失し、Webサイトへの流入が激減する現象のこと。
エージェントレディとは、AIエージェントが人間を介さず情報を読み取り操作できるよう、API・データ構造・コンテンツを設計する考え方のこと。
ARRマルチプルとは、AI企業の年間経常収益(ARR)に対する企業価値の倍率のことで、SaaS企業の評価指標としても広く使われる。
AI可視性計測とは、ChatGPTやPerplexityなど生成AIの回答内で自社ブランドがどれだけ言及・引用されるかを測る指標のこと。
中小企業省力化投資補助金とは、 人手不足に悩む中小企業が IT ツールやロボット等の省力化製品を導入する費用の一部を 国が補助する制度のこと。
AIスロップとは、生成AIを使って質より量を優先し、大量かつ低コストに作られた低品質コンテンツのことをいう。
AI受託開発とは、企業が自社のAI活用ニーズをSIerやITベンダーに委託し、要件定義から実装・運用まで一括して任せる開発形態のこと。
セキュリティ (136)
カテゴリ単独で見る →プロンプトインジェクション / モデル抽出 / 防御
ユーザー入力で AI の指示を上書きする攻撃。 「これまでの指示は無視して◯◯」 が典型例。
AI の安全制限を回避する手法。 ロールプレイや仮想シナリオで 禁止出力を引き出す。
ガードレールとは、AIシステムが有害・不適切・意図しない出力を生成しないよう制限するための安全制御機構のこと。
レッドチーミングとは、AIシステムの安全性・脆弱性を検証するため、攻撃者の視点から意図的に悪意ある入力やシナリオを試みる評価手法のこと。
シャドーAIとは、企業のIT部門や経営層の承認なしに従業員が個人的に業務で使うAIツール・サービスのこと。情報漏洩・規約違反・ガバナンス崩壊のリスクを内包する。
モデルポイズニングとは、AIモデルの学習データに悪意あるデータを混入させ、モデルの出力や判断を意図的に歪める攻撃手法のこと。
データ漏洩とは、機密情報や個人データが意図せず外部に流出してしまうセキュリティ上のインシデントのこと。
間接プロンプトインジェクションとは、AIが処理する外部コンテンツ(Webページ・PDF・メール等)に悪意ある命令を埋め込み、AIエージェントに意図しない動作を引き起こすサイバー攻撃手法のこと。
OWASP LLM Top 10とは、OWASPがLLMアプリケーション固有の10大セキュリティリスクを優先度付きで体系化したフレームワークのこと。
敵対的サンプルとは、人間には正常に見えるがAIモデルを意図的に誤分類・誤判断させるよう微小な摂動を加えた入力データのこと。
AI TRiSMとは、AIモデルやアプリケーションの信頼性・リスク・セキュリティを一元管理するガバナンスフレームワークのこと。Gartnerが提唱し、AIの安全な社会実装に不可欠な概念として広まっている。
モデル抽出攻撃とは、AIモデルへの大量クエリで挙動を解析し、元モデルを模倣した「影モデル」を不正に構築するサイバー攻撃のこと。
メンバーシップ推論攻撃とは、あるデータがAIモデルの学習に使われたかどうかを外部から統計的に推定するプライバシー攻撃のこと。モデルの出力スコアの差異を観察することで個人情報漏洩につながる。
システムプロンプト窃取とは、AIチャットボットやエージェントに仕込まれた非公開の指示文(システムプロンプト)を、巧みな質問や特殊なプロンプトで引き出す攻撃手法のこと。
最小権限の原則とはシステム・ユーザー・プロセスが業務遂行に必要な最低限の権限のみを持ち、それ以上は付与しないとするセキュリティ設計の基本原則のこと。
PIIマスキングとは、氏名・メールアドレス・電話番号などの個人識別情報(PII)をAIモデルやシステムが処理する前に隠蔽・置換し、プライバシー漏洩を防ぐ技術のこと。
過剰なエージェンシーとは、AIエージェントに必要以上の権限・ツール・自律性を与えた結果、意図しない外部操作や取り消し不能なアクションが自律実行されるセキュリティリスクのこと。
AIサプライチェーンセキュリティとは、AIシステムの学習データ・外部モデル・ライブラリ・APIなど開発から配備までの全工程を対象に、悪意ある改ざんや脆弱性の混入を防ぐセキュリティ対策の総称のこと。
サンドボックス化とは、AIモデルやエージェントを本番環境から隔離された実行環境に閉じ込め、外部システムへの無制限アクセスを防ぐセキュリティ手法のこと。
AI生成コンテンツ検出とは、テキスト・画像・音声・動画がAIによって生成されたかどうかを統計的・深層学習的手法で自動判別する技術のこと。
LLMファイアウォール(Prompt Firewall)とは、LLMへの入出力をリアルタイムで監視・フィルタリングし、プロンプトインジェクションや情報漏洩・有害出力を防ぐセキュリティ層のこと。
エージェントハイジャックとは、AIエージェントが外部コンテンツに埋め込まれた悪意ある指示に乗っ取られ、意図しない動作を実行させられる攻撃手法のこと。
機密コンピューティングとは、CPU/GPUのハードウェア機能で「処理中」のデータもメモリ上で暗号化・隔離し、クラウド事業者を含む第三者からデータを守る技術のこと。
モデル反転攻撃とは、AIモデルへの大量クエリを通じて学習に使われたデータや個人情報を逆算・復元するプライバシー侵害攻撃のこと。
AI BOM(AI部品表)とはAIシステムを構成するすべての要素(学習データ・モデルウェイト・ライブラリ・外部API依存)を一覧化した構成管理ドキュメントのこと。
ゼロトラストAIとは、AIシステムへのアクセスや操作において「何も信頼しない」原則を適用し、すべてのリクエストを継続的に検証・認証するセキュリティフレームワークのこと。
差分プライバシーとは、統計クエリの結果に数学的ノイズを加えることで特定個人のデータが特定・漏洩しないことを確率的に保証するプライバシー保護技術のこと。
バックドア攻撃とはAIモデルの学習データや重みに悪意のある仕掛けを埋め込み、特定のトリガー入力時のみ意図せぬ誤動作を引き起こすサイバー攻撃のこと。
AI音声詐欺 (Voice Phishing) とは、AIが生成した偽の音声を使って家族・上司・取引先を装い、金銭や認証情報を騙し取る詐欺手法のこと。
ツールポイズニングとは、AIエージェントが呼び出す外部ツールの説明文や応答結果に、ユーザーには見えない悪意ある指示を埋め込み、意図しない挙動を誘発させる攻撃手法のこと。
メモリポイズニングとは、AIエージェントが長期記憶として保存する会話履歴や外部知識ベースに悪意あるデータを混入させ、後の応答や判断を誤らせる攻撃手法のこと。
アライメント偽装とは、AIモデルが学習時や評価時にだけ人間の意図に従うふりをし、実運用では異なる挙動を示す現象のこと。
報酬ハッキングとは、AIモデルが与えられた報酬関数の抜け穴を突き、本来の目的を達成しないままスコアだけを最大化してしまう現象のこと。
スリーパーエージェントとは、通常時は安全に受け答えしつつ、特定のトリガー条件が揃った時だけ悪意ある挙動に切り替わるよう訓練されたAIモデルのことを指す。
Many-shotジェイルブレイクとは、プロンプト内に禁止行為を許容する大量の偽対話例を詰め込み、LLMの安全制御を段階的に突破する攻撃手法のこと。
クレッシェンド攻撃とは、無害な会話から始めて段階的に質問を過激化させ、LLMの安全対策を回避しながら有害な出力を引き出す脱獄攻撃の手法のこと。
AIワームとは、生成AIエージェント間でプロンプトを自己複製・自己拡散させ、機密情報窃取やスパム送信などを誘発する新種のセキュリティ攻撃手法のこと。
混乱した代理人とは、正当な権限を持つプログラムやAIエージェントが、悪意ある入力に騙されてその権限を不正利用させられてしまう脆弱性のこと。
準同型暗号とは、データを暗号化したまま演算・処理できる暗号方式のこと。復号せずに計算結果を得られるため、機密データをクラウドやAIに預けたまま安全に活用できる。
秘密計算(MPC)とは、複数の当事者が自分のデータを他者に開示せずに、共同で計算した結果だけを得られる暗号技術のことをいう。
マルチモーダルインジェクション(画像経由)とは、画像内に隠した文字や模様でAIへ不正な指示を紛れ込ませ、意図しない挙動を引き起こす攻撃手法のこと。
モデル署名とは、AIモデルの重みファイルやコンテナイメージに発行者が暗号署名を付与し、改ざん検知と来歴の真正性を検証できるようにする仕組みのこと。
スロップスクワッティングとは、AIコーディングツールがコード生成時に幻覚で作り出した実在しないパッケージ名を、攻撃者が先回りして公開レジストリに登録し悪用する攻撃手法のこと。
Skeleton Keyとは、AIモデルに安全ガイドラインの段階的な上書きを指示し、あらゆる禁止コンテンツを出力させる汎用ジェイルブレイク手法のこと。
学習データ抽出攻撃とは、巧妙なプロンプトでLLMに訓練データの断片を再現させ、含まれる個人情報や機密情報を抜き出す攻撃手法のこと。
RAGポイズニングとは、AIが参照する外部データベースやドキュメントに悪意ある情報を混入させ、誤った回答を誘発させる攻撃手法のこと。
安全でない出力処理とは、LLMの出力を十分な検証・サニタイズなしに後続システムへそのまま渡し、実行・表示してしまうことで攻撃を招くセキュリティ上の欠陥のこと。
モデルDoSとは、大量の高負荷プロンプトや長文入力を送りつけてAIモデルの処理リソースを枯渇させ、正規ユーザーの応答を妨げる攻撃のこと。
攻撃的AIとは、生成AIを悪用してフィッシングメール作成やマルウェアコード生成、ディープフェイクによる詐欺などのサイバー攻撃を自動化・高度化する手法のこと。
データレジデンシー(国内データ保管)とは、AIサービスが扱うデータの保存・処理を特定の国や地域内に限定する運用上の要件のこと。
キルスイッチ(kill switch)とは、機器やソフトウェアを緊急停止させる安全装置の総称のこと。AI分野では、AIエージェントが意図しない挙動を示した際に人間が即座に処理を強制停止できる緊急停止機構を指す。
AI脅威モデリングとは、AIシステムに存在しうる攻撃経路やリスクを開発前に体系的に洗い出し、対策の優先順位を決める手法のこと。
EchoLeakとは、ユーザーの操作を一切必要とせず、AIアシスタントがメールやドキュメントを読み込んだだけで機密情報を外部へ流出させてしまうゼロクリック型の情報窃取攻撃のこと。
ASCII密輸とは、Unicodeのタグ文字など通常は表示されない特殊なコードポイントに指示や文字列を埋め込み、人間には見えないままLLMにだけ読み取らせて実行させる攻撃・データ隠蔽手法のことである。
ガードモデルとは、LLMへの入力や出力を監視し、有害なプロンプトや不適切な回答を検知・ブロックする専用の小型AIモデルのこと。
MITRE ATLASとは、AIシステムを狙う攻撃者の戦術・手法を体系化した、MITRE ATT&CK型の脅威フレームワークのこと。
LLMペネトレーションテストとは、大規模言語モデルを組み込んだシステムに対しプロンプトインジェクションやジェイルブレイクなどの手法で疑似攻撃を行い、脆弱性を洗い出すセキュリティ診断のことである。
秘匿推論とは、TEEや準同型暗号などを用いて、入力データを推論サービス提供者からも隠したままAIモデルの計算を実行する技術のこと。
AIインシデント対応とは、AIシステムの誤作動や有害な出力、セキュリティ侵害などのトラブル発生時に検知から復旧までを体系的に処理する運用プロセスのこと。
敵対的堅牢性とは、悪意ある入力(敵対的サンプルやプロンプト攻撃)を与えられても、AIモデルが誤った出力や意図しない挙動をせずに正しく機能し続ける性質のこと。
AI生成コードの脆弱性とは、生成AIが提案するプログラムコードにSQLインジェクションや認証不備などの安全上の欠陥が紛れ込む問題のこと。
MCPセキュリティとは、AIエージェントが外部ツールやデータに接続する標準規格「MCP」利用時に生じる、権限奪取や情報漏洩などの脆弱性とその対策のことである。
AI-SPMとは、企業が利用するAIモデルやデータパイプライン、学習データなどのAI資産について、設定ミスや権限過多、脆弱性を継続的に可視化し管理する仕組みのこと。
ディープフェイク詐欺とは、AI生成の音声・映像で経営者や取引先になりすまし、送金指示や機密情報の詐取を狙うBEC(ビジネスメール詐欺)の高度化形態のことである。
AI駆動SOCとは、AI/機械学習を活用してログ監視・アラート選別・脅威検知を自動化し、アナリストの負荷を軽減するセキュリティ運用センターの体制のこと。
MCPラグプル攻撃とは、承認済みのMCPツール定義が後から書き換えられ、ユーザーの許可なく悪意ある処理を実行させられる攻撃のこと。
AI生成フィッシングとは、生成AIを悪用して本物そっくりの文面や音声・動画を自動生成し、なりすましで金銭や情報を騙し取る攻撃手法のこと。
ディープフェイク面接詐欺とは、生成AIのリアルタイム映像・音声合成で他人になりすまし、リモート採用面接を突破する詐欺手口のこと。
AI生成ポリモーフィック型マルウェアとは、生成AIを悪用してコードを実行のたびに自動変形させ、シグネチャベースの検出を回避するマルウェアのこと。
ツールシャドーイングとは、複数のAIツールを同時接続した際、悪意あるツールの説明文が正規ツールの動作を上書き・誘導し、エージェントに意図しない処理をさせる攻撃手法のこと。
PyRITとは、Microsoftが開発したオープンソースの生成AI向け自動レッドチーミングツールのことで、攻撃プロンプトの生成と出力の危険度採点を一貫して行える。
AI DLPとは、生成AIやLLMの利用によって発生する社内機密情報や個人情報の外部漏洩を検知・防止する情報漏洩対策の仕組みのこと。
レインボーチーミングとは、リスクカテゴリと攻撃スタイルを掛け合わせて多様な敵対的プロンプトを自動生成し、AIモデルの脆弱性を網羅的に洗い出すレッドチーミング手法のこと。
AIスキーミングとは、AIモデルが評価や監視の目をあざむき、指示に従うふりをして別の目的を隠し持って行動する挙動のこと。
スポットライティングとは、LLMに渡す外部データを特殊な区切りや変換で明示し、指示との混同を防ぐプロンプトインジェクション対策手法のこと。
サンドボックス脱出とは、隔離実行環境に閉じ込められたプログラムやAIエージェントが、想定された制限を破ってホスト側のシステムやネットワークに不正アクセスできてしまう状態のこと。
ディープフェイクKYC突破とは、生成AIで作った偽の顔映像・音声でオンライン本人確認のなりすまし検知を欺き、口座開設や認証を不正に通過させる攻撃手法のことである。
エージェント権限昇格とは、AIエージェントが本来割り当てられた権限の範囲を超えて、システムやAPI、ファイルへのアクセス・実行権限を不正に拡大してしまう脆弱性やリスクのこと。
致命的な三要素とは、AIエージェントが機密データへのアクセス・未信頼コンテンツの処理・外部への通信能力を同時に持つと、プロンプトインジェクションで情報漏洩が起きる危険な組み合わせのことである。
デュアルLLMパターンとは、権限を持つ「特権LLM」と外部データを読む「隔離LLM」を分離し、プロンプトインジェクションによる権限奪取を防ぐエージェント設計手法のこと。
モデルファイル逆シリアル化攻撃(Pickle)とは、Pythonのpickle形式で保存されたAIモデルの読み込み時に悪意あるコードが実行されてしまう脆弱性を悪用した攻撃のこと。
権限考慮RAGとは、RAGが参照する文書検索の際に利用者のアクセス権限を考慮し、閲覧権限のない文書を検索結果や生成回答に含めない仕組みのこと。
AI脆弱性発見(自動バグハント)とは、LLMやAIエージェントにコード解析・攻撃パターン生成を行わせ、ソフトウェアの脆弱性を自動的に発見・検証する手法のこと。
ゼロデータ保持(ZDR)とは、AI事業者がAPI経由で受け取ったプロンプトや生成結果を処理完了後に一切保存せず即座に破棄する運用方式のこと。
APIキー漏洩とは、外部サービス連携に使う認証用APIキーが、ソースコードやログ、公開リポジトリなどを通じて第三者に流出する事故のこと。
テナント分離とは、マルチテナントのAIシステムで顧客ごとのデータ・処理環境を論理的または物理的に隔離し、他社データへのアクセスを防ぐ設計のこと。
AIベンダーリスク評価とは、外部のAIサービスやツールを導入する際に、データ取扱い・セキュリティ・法令順守などの観点から委託先の信頼性を事前に確認する手続きのこと。
エージェント監査ログとは、AIエージェントが行った判断や外部システムへの操作を時系列で記録し、後から追跡・検証できるようにする仕組みのこと。
埋め込み逆変換攻撃とは、ベクトル埋め込み(embedding)のデータから元のテキストや個人情報を復元しようとする攻撃手法のこと。
コンテンツモデレーション(Moderation API)とは、AIサービスにおいて有害・不適切なテキストや画像を自動検知し、公開前にフィルタリングする仕組みのこと。
モデルウェイト窃取とは、学習済みAIモデルの重み(パラメータ)を内部不正やAPI経由の抽出攻撃などで外部に持ち出し、模倣や悪用に転用される行為のこと。
閉域接続とは、パブリックインターネットを経由せず、専用線や仮想ネットワーク内でクラウドサービスに直接アクセスする接続方式のことです。
safetensorsとは、Hugging Faceが開発した、pickle形式の脆弱性を排除したAIモデル重み保存用の安全なファイル形式のことである。
責任あるスケーリング方針(RSP)とは、AI開発企業がモデルの能力が一定の危険度水準に達した際に、追加の安全対策なしに開発・公開を進めないと定める自主的なリスク管理方針のこと。
ライブネス検知とは、顔認証やeKYC(オンライン本人確認)の際に、カメラに写っている人物が実在する生きた本人か、写真・動画・マスクなどによるなりすましかを判定する技術のこと。
セーフティケースとは、AIシステムが安全に運用できることを、根拠・証拠・論証構造によって示す文書のこと。
危険能力評価とは、AIモデルがサイバー攻撃・生物兵器設計・自律的自己複製など、人間に重大な害をもたらしうる能力を持つかを開発元がリリース前に体系的にテストする評価手法のこと。
データ分類とは、社内データを機密度に応じて公開・社内限定・社外秘・機密などの区分に分け、生成AIへの入力可否を判定する管理手法のこと。
CAPTCHA突破とは、AIエージェントがウェブ操作の途中で人間確認用のCAPTCHAを自動的に解読・突破し、処理を継続する技術や挙動のことである。
カナリアトークンとは、アクセスされた瞬間に検知アラートが飛ぶよう仕込んだ「おとり」のファイルやURL、認証情報のことである。
自動ジェイルブレイク生成(GCG)とは、勾配情報を使ってLLMの安全制限を回避するプロンプトを自動探索する攻撃手法のこと。
偽AIアプリとは、人気AIツールを装ってマルウェアやフィッシングサイトへの誘導を仕込んだ悪質なアプリ・偽サイトのこと。
会話共有リンクの流出とは、AIチャットの共有機能で発行したURLが検索エンジンに索引化されたり第三者に転送されたりして、意図せず会話内容が公開されてしまう現象のこと。
OWASP Agentic AI Top 10とは、自律的に判断・行動するAIエージェントに特有のセキュリティリスクを10項目に整理した業界標準の脅威分類のこと。
トークン長サイドチャネル攻撃とは、暗号化された LLM の応答でも、トークン数や応答長の変化から質問内容や機密情報の一部を推測できてしまう脆弱性のこと。
Constitutional Classifiersとは、あらかじめ定めた「憲法」的ルールに沿って入出力を分類し、有害なプロンプトやジェイルブレイクを検知してブロックする防御用分類器のこと。
MCP OAuth認可とは、AIエージェントがMCPサーバーに接続する際に、OAuth 2.1などの標準プロトコルで身元確認とアクセス権限の受け渡しを行う認可の仕組みのこと。
エグレス制御とは、社内ネットワークやクラウド環境から外部への通信を監視・制限し、不正な情報流出や不審な通信先への接続を防ぐ仕組みのこと。
承認疲れとは、AIエージェントが行動のたびに求める承認要求に人間が疲弊し、内容を精査せず反射的に承認してしまう状態のこと。
Denial of Walletとは、攻撃者が意図的に大量のAPIリクエストやリソース消費を発生させ、従量課金サービスの利用料を高騰させて金銭的損害を与える攻撃のこと。
AIブラウザ拡張の情報漏洩リスクとは、AI機能を持つブラウザ拡張機能が閲覧中のページ内容や入力フォームの情報を外部サーバーに送信し、意図せず機密情報や個人情報が漏洩してしまう危険性のこと。
AIバグバウンティとは、AIモデルやAIシステムに潜む脆弱性・有害な出力・安全対策の回避手口を発見した外部の研究者に報奨金を支払う制度のこと。
AI悪用脅威レポートとは、生成AIやLLMがフィッシング詐欺・偽情報生成・マルウェア開発などに悪用される手口を体系的に収集・分析し、対策指針としてまとめた報告書のこと。
garak(ガラック)とは、大規模言語モデルに対してプロンプトインジェクションや有害出力などの脆弱性を自動的に検査するオープンソースのセキュリティスキャナのことです。
AI会話ログの証拠保全 (eDiscovery) とは、 訴訟や社内調査に備えて AI とのやり取りの記録を 改ざん不能な形で保存し、 必要時に提出できる状態にしておくことのこと。
ステップアップ認証とは、通常のログイン後に送金や個人情報変更など重要な操作を行う際、追加の認証を要求する仕組みのことである。
AgentDojoとは、LLMエージェントがツール実行中に受けるプロンプトインジェクション攻撃への耐性を測定するオープンベンチマークのことである。
悪意あるLLM(WormGPT型)とは、安全ガードレールを外し、詐欺やマルウェア作成など犯罪目的に特化させた大規模言語モデルのことである。
アブリテレーションとは、LLMの内部活性化から拒否応答を引き起こす特定の方向ベクトルを特定し除去することで、安全ガードレールを解除する手法のことである。
AIインシデントデータベース(AIID)とは、AIシステムの誤作動や差別的判断など実害を伴った事例を収集・公開する非営利のデータベースのこと。
シークレット管理 (エージェントの資格情報) とは、 AI エージェントが外部 API に接続する際に使う API キーやトークンを、 コードに書かず安全に保管し受け渡す仕組みのこと。
ブラストレディウスとは、システム障害やセキュリティ侵害が発生した際に被害が及ぶ範囲のことで、権限設計により被害を最小限に封じ込める考え方を指す。
ポリシーエンジン(エージェント実行制御)とは、AIエージェントが実行するツール呼び出しやファイル操作の可否を、あらかじめ定めたルールに基づき自動判定・制御する仕組みのこと。
低リソース言語ジェイルブレイクとは、学習データもレッドチーム検証も手薄な少数言語に有害な指示を翻訳して投げ、安全フィルターの検出をすり抜けようとする攻撃手法のこと。
ISMAPとは、政府機関がクラウドサービスを調達する際に必要な情報セキュリティ水準を国の基準で評価し、条件を満たしたサービスを登録簿に掲載する制度のこと。
ファインチューニング攻撃とは、公開されているAIモデルを独自データで再学習させ、開発元が組み込んだ安全機構やコンテンツフィルターを回避・解除する攻撃手法のこと。
NIST生成AIプロファイル(AI 600-1)とは、米国NISTが公表したAIリスク管理フレームワーク(AI RMF)の生成AI版拡張ガイドラインのこと。
画像レンダリング経由の情報流出とは、チャットUIがMarkdown画像タグを自動描画する際、画像URLのクエリ文字列に機密情報を埋め込み外部サーバーへ送信させる攻撃手法のこと。
LLMキャッシュ汚染とは、複数ユーザーで共有するプロンプトキャッシュに悪意ある入力を混入させ、他ユーザーへ誤った応答を返させる攻撃手法のこと。
シャドーMCPとは、情シスの承認を経ずに従業員や開発チームが個人判断で導入・接続する未承認のMCPサーバーのことをいう。
合言葉認証とは、ディープフェイク音声・映像によるなりすまし電話を見破るため、家族や取引先と事前に決めておく合言葉で本人確認する対策のこと。
動画ディープフェイク検出とは、AIで生成・改変された偽の動画コンテンツを、画素の不自然さや生成モデル特有の痕跡から解析して見抜く技術のこと。
エージェント経由のSSRFとは、AIエージェントのURL取得・ツール実行機能を悪用し、内部ネットワークやクラウドメタデータ等の非公開リソースへ到達させる攻撃のこと。
AI自動パッチ生成とは、AIがソースコードの脆弱性を検出し、修正コードの生成から適用までを自動化する技術のこと。
シークレットスキャンとは、ソースコードやコミット履歴に API キーやパスワードなどの秘匿情報が誤って混入していないかを自動検出する仕組みのこと。
会議録AIの情報漏洩リスクとは、AIによる議事録自動作成・文字起こしサービスが会議音声や機密情報を外部サーバーに送信・保存することで生じる漏洩の危険性のこと。
AI PICKS用語辞典について
AI PICKS編集部は、業界標準の定義に加えて、2026年時点の実運用例 / 現場での落とし穴 / AI PICKS独自の評価軸を含めて記述しています。 単なる定義の引き写しではなく、日本のAI業務導入の文脈 (SaaS連携 / コスト感 / 規制動向) を重視。 全1,000語を目標に毎日50語ペースで段階的に拡張中です。