Suno / ElevenLabs / Whisperなどの音声AI
153語を50音順で表示
音声・音楽の用語153語
- RTF (実時間係数)あーるてぃーえふ(じつじかんけいすう)RTF(実時間係数)とは、音声処理にかかった時間を音声の長さで割った指標のこと。1未満なら実時間より高速、1超なら実時間より低速な処理を意味する。
- RVC (検索ベース音声変換)あーるぶいしーRVCとは、検索ベース音声変換(Retrieval-based Voice Conversion)により、入力音声のピッチやニュアンスを保ったまま話者の声質を別の声に変換するAI音声技術のこと。
- 相槌生成 (Backchannel)あいづちせいせい相槌生成(Backchannel)とは、音声対話AIが会話中に「うん」「はい」「なるほど」等の相槌を自然なタイミングで挿入し、間合いを埋める技術のこと。
- AivisSpeech (日本語音声合成)あいびすすぴーちAivisSpeechとは、感情豊かなキャラクターボイスを無料で生成できるオープンソースの日本語テキスト音声合成エンジンのこと。
- アクセント核 (日本語ピッチアクセント)あくせんとかくアクセント核とは、日本語の単語内で音の高さが高い部分から低い部分へ下がる直前の拍を指す、音声合成・音声認識で発音の自然さを左右する言語学用語のこと。
- アクセント変換 (Accent Conversion)あくせんとへんかんアクセント変換とは、話者の声質や発話内容を保ったまま、発音のアクセント(訛り)だけを別のアクセントに置き換える音声AI技術のこと。
- AmiVoice (国産音声認識エンジン)あみぼいすAmiVoiceとは、アドバンスト・メディアが開発する国産の音声認識エンジンで、医療・コールセンター・議事録作成など業種特化の高精度認識に強みを持つサービスのこと。
- ElevenLabsいれぶんらぼAI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
- 韻律制御 (Prosody)いんりつせいぎょ (ぷろそでぃ)韻律制御とは、AI音声合成においてスピーチのピッチ・リズム・アクセント・抑揚・発話速度を制御し、自然で感情豊かな音声を生成する技術のこと。
- VALL-E (ゼロショット音声モデル)ゔぁるいーVALL-Eとは、数秒のサンプル音声だけで話者の声質を再現し、追加学習なしにテキストを読み上げさせるゼロショット音声合成モデルのこと。
- WhisperうぃすぱーOpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
- ウェイクワード検出 (Wake Word)うぇいくわーどけんしゅつウェイクワード検出とは、デバイスが常時マイク入力を監視し、「OK Google」「Hey Siri」のような特定の起動語を検知した瞬間だけ音声認識処理を開始する仕組みのこと。
- WebRTC (リアルタイム音声通信基盤)うぇぶあーるてぃーしーWebRTCとは、ブラウザやスマホアプリ同士が専用サーバーを介さずリアルタイムで音声・映像を送受信できるオープン標準の通信技術のこと。
- 歌声合成 (Singing Voice Synthesis)うたごえごうせい歌声合成とは、楽譜・歌詞・音程情報をもとにAIが人間の歌声を自動生成する技術のこと。VOCALOIDに代表される波形接続方式から、深層学習を用いたエンドツーエンド生成へと進化し、2020年代に急速に普及した。
- 歌声変換 (Singing Voice Conversion)うたごえへんかん歌声変換とは、 ある人が歌った音源の声質だけを 別の話者・キャラクターの声に置き換える AI 技術のこと。
- AIオーディオブック生成 (AI Audiobook)えーあいおーでぃおぶっくせいせいAIオーディオブック生成とは、書籍やテキスト原稿をAI音声合成で読み上げ、聞ける音声コンテンツに自動変換する技術のこと。
- AI音声広告生成 (Audio Ad)えーあいおんせいこうこくせいせいAI音声広告生成(Audio Ad)とは、AIがナレーション音声・BGM・効果音を自動生成し、ラジオやポッドキャスト向けの音声広告を制作する技術のこと。
- AI音声編集 (フィラー除去)えーあいおんせいへんしゅう(ふぃらーじょきょ)AI音声編集とは、音声データ内の「えー」「あの」などのフィラーや無音区間をAIが自動検出して除去し、聞きやすく整える技術のこと。
- AI歌詞生成 (Lyrics Generation)えーあいかしせいせいAI歌詞生成とは、テーマやジャンル、感情の起伏などを指定するだけでAIが楽曲の歌詞案を自動生成する技術のことを指す。
- AI楽曲の配信規約 (ストリーミング各社のAI方針)えーあいがっきょくのはいしんきやくAI楽曲の配信規約とは、SpotifyやApple Musicなど主要ストリーミング各社がAI生成楽曲の配信可否や収益化条件について定める運用ルールのことである。
- AI楽曲判定 (AI Music Detection)えーあいがっきょくはんていAI楽曲判定とは、楽曲がAI生成モデルによって作られたものか人間の制作かを、音響的特徴やメタデータの解析によって識別する技術のこと。
- AI電話応対 (ボイスボット)えーあいでんわおうたいAI電話応対 (ボイスボット) とは、 音声認識と音声合成を組み合わせ、 電話での問い合わせ・予約対応を AI が自動でこなす仕組みのこと。
- AIノイズ除去 (Noise Suppression)えーあいのいずじょきょAIノイズ除去とは、機械学習モデルを使って音声・動画から背景雑音やハム音を自動的に取り除く技術のこと。
- AI吹き替え (AI Dubbing)えーあいふきかえAI吹き替えとは、映像コンテンツの音声を自動翻訳・合成し、別言語の自然な音声に置き換えるAI技術のこと。
- AIポッドキャスト生成 (AI Podcast Generation)えーあいぽっどきゃすとせいせいAIポッドキャスト生成とは、テキスト原稿や箇条書きメモをもとにAIが音声合成・編集・BGM付与までを自動で行い、ポッドキャスト番組を丸ごと生成する技術のこと。
- AIマスタリング (AI Mastering)えーあいますたりんぐAIマスタリングとは、AIが楽曲の音量バランスやEQ、音圧を解析し、配信基準に沿った最終調整を自動で行う音楽制作工程のこと。
- AIミキシング (Auto Mixing)えーあいみきしんぐAIミキシングとは、AIが複数の音声トラックの音量バランスやEQ、コンプレッションを自動で調整し楽曲を仕上げる技術のこと。
- ASR (音声認識)えーえすあーる(おんせいにんしき)ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
- エコーキャンセル (AEC)えこーきゃんせるエコーキャンセル(AEC)とは、スピーカーの音がマイクに回り込んで生じるハウリングや反響音を、信号処理でリアルタイムに打ち消す技術のこと。
- SIP電話網接続 (Telephony連携)えすあいぴーでんわもうせつぞくSIP電話網接続 (Telephony連携) とは、AI音声エージェントをSIPプロトコル経由で固定電話・PBX・コールセンターシステムに接続し、電話回線上で音声対話を実現する仕組みのこと。
- SSML (音声合成マークアップ言語)えすえすえむえる(おんせいごうせいまークアップげんご)SSMLとはテキスト読み上げ(TTS)エンジンに対して発音・速度・ポーズ・抑揚などを細かく制御するためのXMLベースのマークアップ言語のこと。
- SN比 (信号対雑音比)えすえぬひSN比とは、音声や音楽の信号成分と雑音成分の強さの比率をデシベル (dB) で表した、録音・再生機器や音声AIの品質を測る基本指標のこと。
- 演技指示付きTTS (Voice Instruction)えんぎしじつきてぃーてぃーえす演技指示付きTTSとは、テキストプロンプトで声の抑揚・感情・話し方を指示しながら音声を生成できる音声合成技術のこと。
- 遠方音声認識 (Far-field ASR)えんぽうおんせいにんしき遠方音声認識(Far-field ASR)とは、話者から数メートル離れたマイクでも雑音や反響がある環境で高精度に発話を認識する音声認識技術のこと。
- Orpheus (オープンTTS)おるふぇうすOrpheusとは、Canopy Labsが公開したLlamaベースのオープンソース音声合成(TTS)モデルのこと。感情豊かな音声をストリーミング生成できる点が特徴とされる。
- 音楽情報検索 (MIR)おんがくじょうほうけんさく音楽情報検索(MIR)とは、楽曲の音響信号やメタデータから、テンポ・キー・和音・ジャンル・類似度などの情報を自動抽出・分析する技術分野のこと。
- 音楽生成 (Music Generation)おんがくせいせい音楽生成とはAIがテキストプロンプトやジャンル指定などの入力をもとに、メロディ・コード・リズムを含む楽曲を自動で生成する技術のこと。
- 音響イベント検出 (Sound Event Detection)おんきょういべんとけんしゅつ音響イベント検出とは、音声ストリームの中からガラス破砕音やサイレン、咳などの特定の音を自動的に識別・分類する技術のこと。
- 音響キャプション生成 (Audio Captioning)おんきょうきゃぷしょんせいせい音響キャプション生成とは、足音や犬の鳴き声、拍手といった音声以外の環境音・効果音をAIが自然言語の説明文に変換する技術のこと。
- 音高推定 (Pitch Detection / F0)おんこうすいてい音高推定とは、音声や楽音の波形から基本周波数(F0)を推定し、声やメロディの高さを数値・時系列データとして抽出する技術のこと。
- 音色変換 (Timbre Transfer)おんしょくへんかん音色変換(Timbre Transfer)とは、ある音源の音高やリズムを保ったまま、声質や楽器の音色だけを別の音源のものに置き換えるAI技術のこと。
- 音声インペインティング (Audio Inpainting)おんせいいんぺいんてぃんぐ音声インペインティングとは、音声データの欠損・ノイズ・不要語などの部分を、AIが前後の文脈から自然な波形として生成し補完する技術のこと。
- 音声埋め込み (Audio Embedding)おんせいうめこみ音声埋め込みとは、音声の特徴量を高次元の数値ベクトルに変換し、話者識別や検索、分類などのAI処理で扱いやすくする技術のこと。
- 音声LLM (Speech LLM)おんせいえるえるえむ音声LLMとは、テキスト変換を介さずに音声を直接理解・生成できる大規模言語モデルのこと。感情や声のトーン・リズムも含めてエンドツーエンドで処理する。
- 音声感情認識 (Speech Emotion Recognition)おんせいかんじょうにんしき音声感情認識とは、話し声の周波数・抑揚・話速などから話者の感情状態を推定する技術のこと。
- 音声言語理解 (SLU)おんせいげんごりかい音声言語理解(SLU)とは、音声認識で文字化した発話から意図やエンティティを抽出し、システムが人間の発話内容を理解できる形に変換する技術のこと。
- 音声透かし (Audio Watermarking)おんせいすかし音声透かしとは、AI生成音声や音楽に検出用の識別情報を人の耳では分からない形で埋め込み、後から機械的にAI生成かどうかを判別できるようにする技術のこと。
- 音声対話の遅延収支 (Latency Budget)おんせいたいわのちえんしゅうし音声対話の遅延収支とは、ASR・LLM応答・TTSの各処理時間を人間が違和感なく会話できる合計時間内に収める設計上の予算配分のこと。
- 音声超解像 (Audio Super-Resolution)おんせいちょうかいぞう音声超解像とは、AIを用いて低サンプリングレートや低ビットレートの音声に失われた高周波成分を推定・補完し、高品質音声へ復元する技術のこと。画像の超解像手法を音響領域に応用したもの。
- 音声ディープフェイク検出 (Voice Deepfake Detection)おんせいでぃーぷふぇいくけんしゅつ音声ディープフェイク検出とは、AI音声合成や声質変換によって作られた偽の音声・なりすまし音声を、波形の不自然さや生成モデル特有のノイズパターンから機械学習で識別する技術のこと。
- 音声トークン (Audio Token)おんせいとーくん音声トークンとは、音声データを音声合成・音声認識AIが処理できるよう離散的な単位に分割したもののこと。
- 音声匿名化 (Voice Anonymization)おんせいとくめいか音声匿名化とは、録音データから話者を特定できる特徴を除去・変換し、発話内容は保ったまま個人を識別できなくする技術のこと。
- 音声入力 (ディクテーション執筆)おんせいにゅうりょく(でぃくてーしょんしっぴつ)音声入力(ディクテーション執筆)とは、キーボードでの手入力の代わりに、話した内容をAIが自動でテキスト化し、そのまま原稿の下書きとして扱う執筆手法のことである。
- 音声認識の幻覚 (ASR Hallucination)おんせいにんしきのげんかく音声認識の幻覚とは、音声認識AIが雑音や無音区間を誤解釈し、実際には話されていない単語や文を書き起こしてしまう現象のことをいう。
- 音声フィンガープリント (Audio Fingerprinting)おんせいふぃんがーぷりんと音声フィンガープリントとは、音声データから特徴的なパターンを抽出し、短いデジタル指紋(ハッシュ値)に変換して識別・照合する技術のこと。
- 音声変換 (Voice Conversion)おんせいへんかん音声変換とは、ある人物の声質・音色を別の人物や任意のスタイルに変換するAI技術のこと。話者の言語内容を保持しながら声のキャラクターだけを変える。
- 音声ユーザーインターフェース (VUI)おんせいゆーざーいんたーふぇーすVUIとは、画面やボタン操作の代わりに話し言葉だけで家電やアプリを操作できる音声ベースの対話インターフェースのこと。
- 音声要約 (Audio Summarization)おんせいようやく音声要約とは、会議や講演の音声データをAIが自動で文字起こしし、要点・決定事項・アクションアイテムを抽出して短くまとめる技術のこと。
- 音素 (Phoneme)おんそ音素(Phoneme)とは、ある言語において意味の違いを生み出す最小の音声単位で、音声認識・音声合成の基本構成要素のことである。
- オンデバイス音声認識おんでばいすおんせいにんしきオンデバイス音声認識とは、クラウドサーバーに音声データを送信せず、端末内で音声をテキストに変換する音声認識技術のこと。
- Cartesia (音声合成モデル)かーてぃしあCartesiaとは、State Space Model(SSM)系アーキテクチャを用いた低遅延音声合成(TTS)モデルを開発するスタートアップ、またはそのモデル自体を指す言葉のこと。
- カスタム語彙登録 (Custom Vocabulary)かすたむごいとうろくカスタム語彙登録とは、音声認識(ASR)や音声合成(TTS)のAIに専門用語・固有名詞・社名などの単語リストを事前登録し、認識精度や発音の自然さを高める仕組みのこと。
- 楽曲延長 (Song Extension)がっきょくえんちょう楽曲延長(Song Extension)とは、AI音楽生成サービスが最初に作った楽曲の続きを自動生成し、曲の尺を延ばす機能のこと。
- 楽曲構成タグ (Song Structure Tags)がっきょくこうせいたぐ楽曲構成タグとは、AI作曲サービスへのプロンプトで[Verse]や[Chorus]のように曲のセクション構成を指定する記法のこと。
- 楽曲スタイル参照 (Audio Reference)がっきょくすたいるさんしょう楽曲スタイル参照(Audio Reference)とは、既存の楽曲や音声クリップを手本としてAIに読み込ませ、その曲調・音色・アレンジ傾向を反映した新規楽曲を生成させる手法のこと。
- 感情音声合成 (Emotional TTS)かんじょうおんせいごうせい感情音声合成(Emotional TTS)とは、テキストを単なる読み上げではなく、喜び・悲しみ・怒りなど人間の感情を模した音声で合成する技術のこと。
- 逆テキスト正規化 (ITN)ぎゃくてきすとせいきか逆テキスト正規化(ITN)とは、音声認識(ASR)が出力した「にせんにじゅうろくねん」のような話し言葉表記を「2026年」のような書き言葉表記に変換する後処理のこと。
- 強制アライメント (Forced Alignment)きょうせいあらいめんと強制アライメントとは、音声データとその書き起こしテキストを単語・音素単位で時間的に対応付け、発話区間ごとの正確なタイムスタンプを自動生成する音声処理技術のこと。
- 空間オーディオ生成 (Spatial Audio Generation)くうかんおーでぃおせいせい空間オーディオ生成とは、AIが音源の位置や広がりを立体的に再現し、没入感のあるサウンドを自動生成する技術のこと。
- 句読点付与 (Punctuation Restoration)くとうてんふよ句読点付与とは、音声認識などで得られた句読点なしのテキストに、文脈から適切な句点・読点を自動挿入する技術のこと。
- 言語識別 (Language Identification)げんごしきべつ言語識別とは、音声やテキストデータに含まれる言語が何語であるかをAIモデルが自動的に判定する技術のこと。
- 効果音生成 (Sound Effect Generation)こうかおんせいせい効果音生成とは、AIがテキストや映像・音声の指示をもとに、爆発音・環境音・UI音などの効果音を自動で生成する技術のこと。
- CoeFont (日本語音声合成)こえふぉんとCoeFontとは、少量の音声データから声質を学習し、入力テキストを自然な読み上げ音声に変換する日本語対応のAI音声合成サービスのこと。
- CosyVoice (コージーボイス)こーじーぼいすCosyVoiceとは、アリババグループの研究チームが開発したオープンソースの音声合成(TTS)モデルで、数秒の音声サンプルから話者の声質を再現するゼロショット音声クローンに対応する技術のこと。
- コード進行生成 (Chord Progression Generation)こーどしんこうせいせいコード進行生成とは、AIがジャンルやムード、キーを指定するだけで音楽的に自然な和音の並び(コード進行)を自動生成する技術のこと。
- コードスイッチング音声認識 (Code-switching ASR)こーどすいっちんぐおんせいにんしきコードスイッチング音声認識とは、1つの発話の中で日本語と英語のように複数言語が入り混じる音声を、言語を切り替えずに単一モデルでそのまま高精度にテキスト化する音声認識技術のこと。
- Kokoro (軽量TTS)ここころKokoroとは、少ないパラメータ数で高品質な音声を生成できる軽量なオープンソースの音声合成(TTS)モデルのこと。
- kotoba-whisper (日本語音声認識モデル)ことばうぃすぱーkotoba-whisperとは、OpenAIのWhisperを日本語音声に特化して蒸留・軽量化した音声認識モデルのことである。
- Content ID (音楽著作権の自動検出)こんてんつあいでぃーContent ID とは音声・動画中の著作権保護コンテンツを音響指紋照合で自動検出する仕組みのこと。
- サウンドスケープ生成 (Soundscape)さうんどすけーぷせいせいサウンドスケープ生成とは、AIが環境音・BGM・効果音を自動合成し、没入感のある背景音響を作り出す技術のこと。
- 残響除去 (Dereverberation)ざんきょうじょきょ残響除去(Dereverberation)とは、録音音声に含まれる部屋の反響・残響成分をAI処理で低減し、発話の明瞭度を高める音声処理技術のこと。
- サンプリングレート (16kHz / 48kHz)さんぷりんぐれーとサンプリングレートとは、1秒間にアナログ音声を何回サンプル(標本)としてデジタル化するかを示す単位のこと。
- CTC (接続主義的時系列分類)しーてぃーしーCTCとは、音声や画像のような時系列データを、事前のアライメント(区切り位置合わせ)なしにラベル列へ変換するニューラルネットワークの学習手法のこと。
- 自動採譜 (Music Transcription)じどうさいふ自動採譜とは、演奏や歌声の音声データをAIが解析し、楽譜やMIDIなどの記譜データへ自動変換する技術のこと。
- 重複発話 (Overlapped Speech)じゅうふくはつわ重複発話とは、会議や通話などで複数の話者の発言が時間的に重なり合って同時に発生する現象のこと。
- Style-Bert-VITS2 (日本語音声合成OSS)すたいるばーとびっつつーStyle-Bert-VITS2とは、感情やスタイルを指定して自然な日本語音声を合成できるオープンソース(OSS)の音声合成エンジンのこと。
- Stable Audio (音楽・効果音生成)すてーぶるおーでぃおStable Audioとは、Stability AIが開発したテキストから音楽・効果音を生成できるAIモデルのこと。オープンウェイト版と商用API版がある。
- ステム分離 (Stem Separation)すてむぶんりステム分離とは、AIが混合された音源ファイルからボーカル・ドラム・ベースなど各パートを個別トラックに分離して抽出する技術のこと。
- ストリーミング音声認識 (Streaming ASR)すとりーみんぐおんせいにんしきストリーミング音声認識(Streaming ASR)とは、音声データを録音完了後ではなく発話と同時に逐次テキスト化する技術のことで、字幕生成や音声アシスタントの即時応答に使われる。
- ストリーミングTTS (Streaming TTS)すとりーみんぐてぃーてぃーえすストリーミングTTSとは、テキストを音声に変換する処理の完了を待たずに、生成済みの音声チャンクを逐次再生することで応答の体感遅延を大幅に短縮する音声合成方式のこと。
- SunoすのAI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
- Sesame (会話音声モデル)せさみSesameとは、米Sesame AI社が開発した会話特化型の音声AIモデルで、自然な間合いと感情表現を伴う音声対話を実現する技術のことである。
- ゼロショット音声合成 (Zero-shot TTS)ぜろしょっとおんせいごうせいゼロショット音声合成とは、数秒の音声サンプルのみから話者の声質・抑揚を学習し、未学習のテキストも自然に読み上げる技術のこと。
- 全二重音声対話 (Full-duplex Voice)ぜんにじゅうおんせいたいわ全二重音声対話とは、送話と受話を同時並行で処理し、会話の割り込みや相槌をリアルタイムで扱えるAI音声インタフェースのこと。
- ターン検出 (Turn Detection)たーんけんしゅつターン検出(Turn Detection)とは、音声対話AIにおいて話者の発話が終わったかどうかをリアルタイムに判定し、AIが応答を返すべきタイミングを見極める技術のこと。
- タイムストレッチ (話速・尺の非破壊調整)たいむすとれっちタイムストレッチとは、音声や音楽のピッチ(音の高さ)を保ったまま再生速度や尺だけを変える非破壊的な音声処理技術のこと。
- 多言語音声合成 (Multilingual TTS)たげんごおんせいごうせい多言語音声合成(Multilingual TTS)とは、複数の言語に対応したテキスト読み上げ技術のこと。自然なイントネーションや発音で、一つのモデルから多言語コンテンツをリアルタイムに音声化できる。
- 多言語ボイスクローン (Cross-lingual Voice Cloning)たげんごぼいすくろーん多言語ボイスクローンとは、話者本人の声質・抑揚・話し方の特徴を保持したまま、学習していない別の言語で発話を合成する技術のこと。
- 単語単位タイムスタンプ (Word-level Timestamps)たんごたんいたいむすたんぷ単語単位タイムスタンプとは、音声を文字起こしする際に各単語ごとの発話開始・終了時刻をミリ秒単位で記録する技術のこと。
- Chatterbox (チャッターボックス)ちゃったーぼっくすChatterbox(チャッターボックス)とは、Resemble AIが公開したオープンソースの音声合成(TTS)モデルで、短い音声から声を再現し感情の強さも調整できる技術のこと。
- 通話分析 (Speech Analytics)つうわぶんせき通話分析とは、コールセンターなどの音声通話をAIが自動でテキスト化・解析し、顧客感情や会話内容から傾向を抽出する技術のこと。
- Dia (対話音声合成)でぃあDiaとは、米Nari Labsが開発したオープンソースの対話音声合成AIモデルで、台本から笑い声や咳払いなどの非言語音まで一括生成できる技術のことである。
- TTS (音声合成)てぃーてぃーえす(おんせいごうせい)TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
- テキスト正規化 (Text Normalization)てきすとせいきかテキスト正規化とは、数字・日付・略語・記号などをTTS/ASRが読み上げやすい表記に統一的に変換する前処理のこと。
- テキスト・トゥ・オーディオ (Text-to-Audio)てきすととぅーおーでぃおテキスト・トゥ・オーディオとは、文章や指示文から音声・効果音・音楽などの音源データを自動生成するAI技術のこと。
- にじボイス (国産AI音声サービス)にじぼいすにじボイスとは、テキストを入力するとAIが多彩なキャラクターボイスで音声を生成する国産のAI音声合成サービスのこと。
- ニューラル音声コーデック (Neural Audio Codec)にゅーらるおんせいこーでっくニューラル音声コーデックとは、ニューラルネットワークを使って音声波形を極限まで圧縮しながら高音質を保つ符号化・復号化技術のこと。TTS・音声クローン・音楽生成モデルの中間表現として急速に普及している。
- 認識信頼度スコア (Confidence Score)にんしきしんらいどすこあ認識信頼度スコアとは、音声認識(ASR)エンジンが出力した文字列1語ごとにどれだけ確信を持って変換したかを0〜1や0〜100%の数値で示す指標のこと。
- バージイン (割り込み発話検知)ばーじいんバージイン(割り込み発話検知)とは、AIが音声で応答中にユーザーが話し始めたことを検知し、AI側の発話を即座に停止してユーザー発話を優先する仕組みのこと。
- 発音辞書 (読み辞書)はつおんじしょ(よみじしょ)発音辞書(読み辞書)とは、音声合成AIや音声認識システムが専門用語・固有名詞・略語を正しい読み方で発音・認識できるよう、単語ごとに読みやアクセントを登録しておく辞書データのことである。
- 発音評価 (語学AIの発音採点)はつおんひょうか発音評価とは、語学学習者の発話を音声認識と音響解析でテキストや音素と照合し、正確さ・流暢さ・イントネーションなどをスコア化するAI機能のこと。
- ハミング検索 (Query by Humming)はみんぐけんさくハミング検索とは、ユーザーが鼻歌やハミングで入力したメロディーを音響特徴量に変換し、既存楽曲データベースと照合して曲名を特定する音声検索技術のこと。
- Parakeet (高速音声認識モデル)ぱらきーとParakeetとは、NVIDIAが開発した高速な音声認識(ASR)モデル群のことで、少ない計算コストで高精度な文字起こしを実現する。
- 伴奏生成 (Accompaniment Generation)ばんそうせいせい伴奏生成とは、入力したメロディやボーカルに合わせてAIがコード進行・リズム・楽器パートを自動作曲し、楽曲の伴奏トラックを生成する技術のこと。
- ビート検出 (Beat Detection)びーとけんしゅつビート検出とは、音楽データの中からリズムの基準となる拍(ビート)の位置やテンポを自動的に解析・特定する技術のこと。
- ビームフォーミング (マイクアレイ集音)びーむふぉーみんぐビームフォーミング (マイクアレイ集音) とは、 複数のマイクを配列 (アレイ) 状に並べ、 位相差を演算処理して 特定方向の音だけを強調して拾う技術のこと。
- ピッチ補正 (Pitch Correction)ぴっちほせいピッチ補正とは、 歌声や話し声の音程のズレを検出し、 目標のピッチへ自動的に近づける音声処理技術のこと。
- ビデオ・トゥ・オーディオ (V2A / 動画から音付け)びでお・とぅ・おーでぃおビデオ・トゥ・オーディオ(V2A)とは、無音の動画に対して映像の動きや場面に合わせた効果音・環境音・音楽を自動生成し付加するAI技術のこと。
- faster-whisper (高速音声認識実装)ふぁすたーうぃすぱーfaster-whisperとは、OpenAIの音声認識モデルWhisperをCTranslate2エンジンで再実装し、推論を高速化・軽量化したオープンソース実装のこと。
- VAD (音声区間検出)ぶいえーでぃ(おんせいくかんけんしゅつ)VADとは音声ストリームの中から人間の発話が含まれる区間だけを自動で切り出す技術のこと。無音・環境ノイズと発話を区別し、音声認識システムの精度向上と計算コスト削減を同時に実現する。
- Fish Audio (フィッシュオーディオ)ふぃっしゅおーでぃおFish Audioとは、数秒の音声サンプルから声をクローンし、多言語のテキスト読み上げ(TTS)を生成できるAI音声合成プラットフォームのこと。
- フォーリー生成 (Foley Generation)ふぉーりーせいせいフォーリー生成とは、映像に合わせた足音や衣擦れ、物の操作音といった環境音効果をAIが自動で作り出す技術のこと。
- 吹き替えの尺合わせ (Duration Matching)ふきかえのしゃくあわせ吹き替えの尺合わせとは、原語音声の発話時間や口の動きに合わせて、翻訳後の吹き替え音声の長さやタイミングを調整する作業のこと。
- ブレス制御 (息継ぎの生成)ぶれすせいぎょブレス制御とは、AI音声合成において不自然な息継ぎ音を抑制したり、逆に自然な間として意図的に挿入したりする技術のこと。
- ボイスエージェント (Voice Agent)ぼいすえーじぇんとボイスエージェントとは、音声を主インターフェースとして会話の理解・推論・実行までを自律的に行うAIエージェントのこと。従来の音声認識やチャットボットと異なり、タスクを自己完結できる点が特徴。
- ボイスクローン (Voice Cloning)ぼいすくろーんボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
- ボイスデザイン (Voice Design)ぼいすでざいんボイスデザインとは、AIアシスタントの声質・口調・感情表現・話し方のスタイルをブランドや用途に合わせて設計・定義する手法のこと。
- VOICEVOX (無料日本語音声合成)ぼいすぼっくすVOICEVOXとは、個人開発者ヒロシバ氏によって開発された無料の日本語音声合成ソフトウェアのことで、テキストを入力するだけでキャラクターごとに異なるアニメ調の音声を生成できる。
- ボイスライブラリ (Voice Library)ぼいすらいぶらりボイスライブラリとは、AI音声合成サービスが用意する多数のボイス(声質・言語・話者性別など)から目的に応じて選び、ナレーションや音声出力に利用できる音声素材集のことである。
- 方言対応 (Dialect Recognition)ほうげんたいおう方言対応とは、音声認識や音声合成AIが標準語以外の地域方言の発音・語彙・イントネーションを正しく認識・処理する機能のこと。
- ボコーダー (Vocoder)ぼこーだーボコーダー(Vocoder)とは、声の周波数特徴を分析・パラメータ化し、別の音源や合成波形にのせて再構成する音声合成・変換技術のこと。
- マルチトラック音楽生成 (Multi-track Generation)まるちとらっくおんがくせいせいマルチトラック音楽生成とは、ボーカル・ドラム・ベースなど楽器パートごとに独立したトラック(ステム)を生成し、後から個別に編集・ミックスできるAI音楽生成方式のこと。
- MIDI生成 (MIDI Generation)みでぃせいせいMIDI生成とはAIがテキストプロンプトやジャンル指定などの入力から、音符・コード進行・テンポ情報を含むMIDIファイルを自動で出力する技術のこと。
- MusicGen (音楽生成モデル)みゅーじっくじぇんMusicGenとは、テキストや旋律の入力から楽曲を自動生成するMeta発のAI音楽生成モデルのこと。
- Mureka (ムレカ音楽生成)むれかMurekaとは、テキストプロンプトから歌詞・ボーカル・伴奏を備えた楽曲を数十秒で自動生成できるAI音楽生成サービスのこと。
- MFCC (メル周波数ケプストラム)めるしゅうはすうけぷすとらむMFCCとは、音声波形を人間の聴覚特性に近いメル尺度でスペクトル分析し、少ない係数で音色的特徴を圧縮表現する、音声認識・話者識別で広く使われる特徴量のこと。
- メルスペクトログラム (Mel Spectrogram)めるすぺくとろぐらむメルスペクトログラムとは、音声波形の周波数成分を人間の聴覚特性に近いメル尺度で分割し、時間軸に沿って表現した2次元の音響特徴量のこと。
- 目的話者抽出 (Target Speaker Extraction)もくてきわしゃちゅうしゅつ目的話者抽出とは、複数の話者が同時に発話する音声の中から、特定の目的話者の声だけを分離抽出する音声処理技術のこと。
- Moshi (全二重音声モデル)もしMoshiとは、フランスのAI研究所Kyutaiが開発した、人間の会話のように相手の発話を遮ったり被せたりしながら同時に聞き話せる全二重(フルデュプレックス)音声対話AIモデルのこと。
- 文字起こしのLLM補正 (Post-correction)もじおこしのえるえるえむほせい文字起こしのLLM補正とは、音声認識(ASR)が出力した書き起こしテキストの誤字・脱字・不自然な言い回しをLLMが文脈から自動修正する後処理のこと。
- Udio (ユーディオ)ゆーでぃおUdio (ユーディオ) とはテキストプロンプトから楽曲・歌詞・ボーカルを一括生成できるAI音楽生成サービスのこと。
- ラウドネス正規化 (Loudness Normalization)らうどねすせいきかラウドネス正規化とは、音声や音楽の体感音量をLUFS基準で自動的に均一化し、視聴環境間の音量差をなくす技術のこと。
- リアルタイム音声 (Realtime Voice)りあるたいむおんせいリアルタイム音声とは、AIが音声入力をほぼ遅延ゼロで認識・生成し、人間同士の会話に近い応答速度を実現する技術のこと。
- リアルタイム音声翻訳 (Speech-to-Speech Translation)りあるたいむおんせいほんやくリアルタイム音声翻訳とは、話者の音声をほぼ遅延なく別の言語の音声に変換するAI技術のこと。同時通訳を自動化し、国際商談やインバウンド対応での言語障壁を即座に解消する。
- リアルタイムボイスチェンジャー (Real-time Voice Changer)りあるたいむぼいすちぇんじゃーリアルタイムボイスチェンジャーとは、マイク入力の声をAIモデルで数十〜数百ミリ秒の低遅延のまま別人の声質へ変換し、配信や通話でそのまま使う技術のこと。
- Riffusion (音楽生成モデル)りふゅーじょんRiffusionとは、音声波形をスペクトログラム画像に変換し、画像生成モデルの技術(Stable Diffusion系の拡散モデル)を応用して音楽を生成するAIモデルのこと。
- ReazonSpeech (日本語音声コーパス)れあぞんすぴーちReazonSpeechとは、テレビ放送音声から構築された国内最大級の日本語音声認識用オープンコーパスのこと。
- ロイヤリティフリーAI音楽 (商用利用権)ろいやりてぃふりーえーあいおんがくロイヤリティフリーAI音楽とは、 AI で生成した楽曲を 追加使用料なしで 商用利用できるライセンス形態のこと。
- 話者埋め込み (Speaker Embedding / x-vector)わしゃうめこみ話者埋め込み(Speaker Embedding)とは、音声から声の特徴を固定長のベクトルに変換し、話者ごとの声紋として識別・比較できるようにする技術のこと。
- 話者属性推定 (年齢・性別推定)わしゃぞくせいすいてい話者属性推定とは、録音音声の声質や話し方の特徴をAIが解析し、話者の年齢層や性別などの属性を推定する技術のこと。
- 話者認識 (Speaker Recognition)わしゃにんしき話者認識とは、音声データから「誰が話しているか」を識別・照合するAI技術のことで、話者の声紋パターンをもとに個人を特定・分類する。
- 話者分離 (Speaker Diarization)わしゃぶんり話者分離とは、複数人の会話音声から「誰がいつ話したか」を自動的に識別・分類する機械学習技術のこと。文字起こしと組み合わせて話者ラベル付き議事録の自動生成などに使われる。
- 話速制御 (Speaking Rate)わそくせいぎょ話速制御(スピーキングレート)とは、音声合成AIが読み上げる速さを数値で細かく調整できる機能のこと。
AI用語辞典のトップへ
全カテゴリ横断で検索・絞り込みができます
辞典トップへ