音声・音楽
Suno / ElevenLabs / Whisperなどの音声AI
64語を50音順で表示
いれぶんらぼ
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
いんりつせいぎょ (ぷろそでぃ)
韻律制御とは、AI音声合成においてスピーチのピッチ・リズム・アクセント・抑揚・発話速度を制御し、自然で感情豊かな音声を生成する技術のこと。
ゔぁるいー
VALL-Eとは、数秒のサンプル音声だけで話者の声質を再現し、追加学習なしにテキストを読み上げさせるゼロショット音声合成モデルのこと。
うぃすぱー
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
うぇいくわーどけんしゅつ
ウェイクワード検出とは、デバイスが常時マイク入力を監視し、「OK Google」「Hey Siri」のような特定の起動語を検知した瞬間だけ音声認識処理を開始する仕組みのこと。
うたごえごうせい
歌声合成とは、楽譜・歌詞・音程情報をもとにAIが人間の歌声を自動生成する技術のこと。VOCALOIDに代表される波形接続方式から、深層学習を用いたエンドツーエンド生成へと進化し、2020年代に急速に普及した。
うたごえへんかん
歌声変換とは、 ある人が歌った音源の声質だけを 別の話者・キャラクターの声に置き換える AI 技術のこと。
えーあいおーでぃおぶっくせいせい
AIオーディオブック生成とは、書籍やテキスト原稿をAI音声合成で読み上げ、聞ける音声コンテンツに自動変換する技術のこと。
えーあいでんわおうたい
AI電話応対 (ボイスボット) とは、 音声認識と音声合成を組み合わせ、 電話での問い合わせ・予約対応を AI が自動でこなす仕組みのこと。
えーあいのいずじょきょ
AIノイズ除去とは、機械学習モデルを使って音声・動画から背景雑音やハム音を自動的に取り除く技術のこと。
えーあいふきかえ
AI吹き替えとは、映像コンテンツの音声を自動翻訳・合成し、別言語の自然な音声に置き換えるAI技術のこと。
えーあいぽっどきゃすとせいせい
AIポッドキャスト生成とは、テキスト原稿や箇条書きメモをもとにAIが音声合成・編集・BGM付与までを自動で行い、ポッドキャスト番組を丸ごと生成する技術のこと。
えーあいますたりんぐ
AIマスタリングとは、AIが楽曲の音量バランスやEQ、音圧を解析し、配信基準に沿った最終調整を自動で行う音楽制作工程のこと。
えーえすあーる(おんせいにんしき)
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
えすえすえむえる(おんせいごうせいまークアップげんご)
SSMLとはテキスト読み上げ(TTS)エンジンに対して発音・速度・ポーズ・抑揚などを細かく制御するためのXMLベースのマークアップ言語のこと。
おるふぇうす
Orpheusとは、Canopy Labsが公開したLlamaベースのオープンソース音声合成(TTS)モデルのこと。感情豊かな音声をストリーミング生成できる点が特徴とされる。
おんがくじょうほうけんさく
音楽情報検索(MIR)とは、楽曲の音響信号やメタデータから、テンポ・キー・和音・ジャンル・類似度などの情報を自動抽出・分析する技術分野のこと。
おんがくせいせい
音楽生成とはAIがテキストプロンプトやジャンル指定などの入力をもとに、メロディ・コード・リズムを含む楽曲を自動で生成する技術のこと。
おんきょういべんとけんしゅつ
音響イベント検出とは、音声ストリームの中からガラス破砕音やサイレン、咳などの特定の音を自動的に識別・分類する技術のこと。
おんこうすいてい
音高推定とは、音声や楽音の波形から基本周波数(F0)を推定し、声やメロディの高さを数値・時系列データとして抽出する技術のこと。
おんせいいんぺいんてぃんぐ
音声インペインティングとは、音声データの欠損・ノイズ・不要語などの部分を、AIが前後の文脈から自然な波形として生成し補完する技術のこと。
おんせいえるえるえむ
音声LLMとは、テキスト変換を介さずに音声を直接理解・生成できる大規模言語モデルのこと。感情や声のトーン・リズムも含めてエンドツーエンドで処理する。
おんせいかんじょうにんしき
音声感情認識とは、話し声の周波数・抑揚・話速などから話者の感情状態を推定する技術のこと。
おんせいすかし
音声透かしとは、AI生成音声や音楽に検出用の識別情報を人の耳では分からない形で埋め込み、後から機械的にAI生成かどうかを判別できるようにする技術のこと。
おんせいちょうかいぞう
音声超解像とは、AIを用いて低サンプリングレートや低ビットレートの音声に失われた高周波成分を推定・補完し、高品質音声へ復元する技術のこと。画像の超解像手法を音響領域に応用したもの。
おんせいでぃーぷふぇいくけんしゅつ
音声ディープフェイク検出とは、AI音声合成や声質変換によって作られた偽の音声・なりすまし音声を、波形の不自然さや生成モデル特有のノイズパターンから機械学習で識別する技術のこと。
おんせいへんかん
音声変換とは、ある人物の声質・音色を別の人物や任意のスタイルに変換するAI技術のこと。話者の言語内容を保持しながら声のキャラクターだけを変える。
おんせいようやく
音声要約とは、会議や講演の音声データをAIが自動で文字起こしし、要点・決定事項・アクションアイテムを抽出して短くまとめる技術のこと。
かんじょうおんせいごうせい
感情音声合成(Emotional TTS)とは、テキストを単なる読み上げではなく、喜び・悲しみ・怒りなど人間の感情を模した音声で合成する技術のこと。
きょうせいあらいめんと
強制アライメントとは、音声データとその書き起こしテキストを単語・音素単位で時間的に対応付け、発話区間ごとの正確なタイムスタンプを自動生成する音声処理技術のこと。
こうかおんせいせい
効果音生成とは、AIがテキストや映像・音声の指示をもとに、爆発音・環境音・UI音などの効果音を自動で生成する技術のこと。
ここころ
Kokoroとは、少ないパラメータ数で高品質な音声を生成できる軽量なオープンソースの音声合成(TTS)モデルのこと。
すてむぶんり
ステム分離とは、AIが混合された音源ファイルからボーカル・ドラム・ベースなど各パートを個別トラックに分離して抽出する技術のこと。
すとりーみんぐおんせいにんしき
ストリーミング音声認識(Streaming ASR)とは、音声データを録音完了後ではなく発話と同時に逐次テキスト化する技術のことで、字幕生成や音声アシスタントの即時応答に使われる。
すの
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
せさみ
Sesameとは、米Sesame AI社が開発した会話特化型の音声AIモデルで、自然な間合いと感情表現を伴う音声対話を実現する技術のことである。
ぜろしょっとおんせいごうせい
ゼロショット音声合成とは、数秒の音声サンプルのみから話者の声質・抑揚を学習し、未学習のテキストも自然に読み上げる技術のこと。
ぜんにじゅうおんせいたいわ
全二重音声対話とは、送話と受話を同時並行で処理し、会話の割り込みや相槌をリアルタイムで扱えるAI音声インタフェースのこと。
たーんけんしゅつ
ターン検出(Turn Detection)とは、音声対話AIにおいて話者の発話が終わったかどうかをリアルタイムに判定し、AIが応答を返すべきタイミングを見極める技術のこと。
たげんごおんせいごうせい
多言語音声合成(Multilingual TTS)とは、複数の言語に対応したテキスト読み上げ技術のこと。自然なイントネーションや発音で、一つのモデルから多言語コンテンツをリアルタイムに音声化できる。
でぃあ
Diaとは、米Nari Labsが開発したオープンソースの対話音声合成AIモデルで、台本から笑い声や咳払いなどの非言語音まで一括生成できる技術のことである。
てぃーてぃーえす(おんせいごうせい)
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
てきすととぅーおーでぃお
テキスト・トゥ・オーディオとは、文章や指示文から音声・効果音・音楽などの音源データを自動生成するAI技術のこと。
にゅーらるおんせいこーでっく
ニューラル音声コーデックとは、ニューラルネットワークを使って音声波形を極限まで圧縮しながら高音質を保つ符号化・復号化技術のこと。TTS・音声クローン・音楽生成モデルの中間表現として急速に普及している。
ばーじいん
バージイン(割り込み発話検知)とは、AIが音声で応答中にユーザーが話し始めたことを検知し、AI側の発話を即座に停止してユーザー発話を優先する仕組みのこと。
びーとけんしゅつ
ビート検出とは、音楽データの中からリズムの基準となる拍(ビート)の位置やテンポを自動的に解析・特定する技術のこと。
ぴっちほせい
ピッチ補正とは、 歌声や話し声の音程のズレを検出し、 目標のピッチへ自動的に近づける音声処理技術のこと。
びでお・とぅ・おーでぃお
ビデオ・トゥ・オーディオ(V2A)とは、無音の動画に対して映像の動きや場面に合わせた効果音・環境音・音楽を自動生成し付加するAI技術のこと。
ぶいえーでぃ(おんせいくかんけんしゅつ)
VADとは音声ストリームの中から人間の発話が含まれる区間だけを自動で切り出す技術のこと。無音・環境ノイズと発話を区別し、音声認識システムの精度向上と計算コスト削減を同時に実現する。
ふぃっしゅおーでぃお
Fish Audioとは、数秒の音声サンプルから声をクローンし、多言語のテキスト読み上げ(TTS)を生成できるAI音声合成プラットフォームのこと。
ぼいすえーじぇんと
ボイスエージェントとは、音声を主インターフェースとして会話の理解・推論・実行までを自律的に行うAIエージェントのこと。従来の音声認識やチャットボットと異なり、タスクを自己完結できる点が特徴。
ぼいすくろーん
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
ぼいすでざいん
ボイスデザインとは、AIアシスタントの声質・口調・感情表現・話し方のスタイルをブランドや用途に合わせて設計・定義する手法のこと。
ぼこーだー
ボコーダー(Vocoder)とは、声の周波数特徴を分析・パラメータ化し、別の音源や合成波形にのせて再構成する音声合成・変換技術のこと。
みでぃせいせい
MIDI生成とはAIがテキストプロンプトやジャンル指定などの入力から、音符・コード進行・テンポ情報を含むMIDIファイルを自動で出力する技術のこと。
みゅーじっくじぇん
MusicGenとは、テキストや旋律の入力から楽曲を自動生成するMeta発のAI音楽生成モデルのこと。
むれか
Murekaとは、テキストプロンプトから歌詞・ボーカル・伴奏を備えた楽曲を数十秒で自動生成できるAI音楽生成サービスのこと。
もし
Moshiとは、フランスのAI研究所Kyutaiが開発した、人間の会話のように相手の発話を遮ったり被せたりしながら同時に聞き話せる全二重(フルデュプレックス)音声対話AIモデルのこと。
ゆーでぃお
Udio (ユーディオ) とはテキストプロンプトから楽曲・歌詞・ボーカルを一括生成できるAI音楽生成サービスのこと。
りあるたいむおんせい
リアルタイム音声とは、AIが音声入力をほぼ遅延ゼロで認識・生成し、人間同士の会話に近い応答速度を実現する技術のこと。
りあるたいむおんせいほんやく
リアルタイム音声翻訳とは、話者の音声をほぼ遅延なく別の言語の音声に変換するAI技術のこと。同時通訳を自動化し、国際商談やインバウンド対応での言語障壁を即座に解消する。
りあるたいむぼいすちぇんじゃー
リアルタイムボイスチェンジャーとは、マイク入力の声をAIモデルで数十〜数百ミリ秒の低遅延のまま別人の声質へ変換し、配信や通話でそのまま使う技術のこと。
わしゃにんしき
話者認識とは、音声データから「誰が話しているか」を識別・照合するAI技術のことで、話者の声紋パターンをもとに個人を特定・分類する。
わしゃぶんり
話者分離とは、複数人の会話音声から「誰がいつ話したか」を自動的に識別・分類する機械学習技術のこと。文字起こしと組み合わせて話者ラベル付き議事録の自動生成などに使われる。
他のカテゴリ
GPT / Claude / Geminiなど大規模言語モデルの基礎用語
AIから良い出力を得るための指示文の設計手法
社内資料や外部DBを検索してAIに答えさせる技術
自律的に計画・行動を繰り返すAIの設計
Midjourney / Stable Diffusion / DALL-Eなど
Sora / Runway / Klingなど動画AI
MMLU / HumanEval / ArenaなどAIの評価軸
GPU / 推論 / 量子化 / FP8など計算基盤
EU AI Act / 著作権 / バイアスなど
業務自動化 / SaaS統合 / DX
プロンプトインジェクション / モデル抽出 / 防御
AI用語辞典のトップへ
全カテゴリ横断で検索・絞り込みができます
辞典トップへ