相槌生成 (Backchannel)
読み: あいづちせいせい
最終更新: 2026-07-30・AI PICKS編集部
定義
相槌生成(Backchannel)とは、音声対話AIが会話中に「うん」「はい」「なるほど」等の相槌を自然なタイミングで挿入し、間合いを埋める技術のこと。
相槌生成 (Backchannel)とは — 詳しく解説
相槌生成(Backchannel)は、音声対話システムにおいてユーザーの発話中や発話の合間に「うん」「はい」「なるほど」といった短い相槌を適切なタイミングで自動生成し、会話の自然さを高める技術で、音声対話における「聞いている感」を演出する要素として位置づけられる。従来の音声アシスタントは発話が終わるまで無音のまま待つ設計が主流だったが、相槌が入らないと人間側が「聞こえているか不安」になり会話が途切れがちになるとされる。2026年時点の実運用では、コールセンターAIや音声エージェントに組み込む際、相槌のタイミングを誤ると発話を遮ってしまう「割り込み」が起きやすく、VAD(音声区間検出)の精度とレイテンシがボトルネックになりやすい。現場では相槌の種類・頻度をペルソナごとに調整し、業種によっては相槌を意図的に減らすチューニングが行われることもある。また低遅延な相槌生成には追加の推論コストがかかるため、既存の音声合成パイプラインに後付けする場合はコスト対効果を見極めた選定が必要とされる。
相槌生成 (Backchannel)の使用例
- 音声エージェントのシステムプロンプトに『発話中は200〜500msごとに短い相槌のみ生成し、文は作らない』と制約を入れる設計例。
- VADの無音区間が0.3秒未満なら相槌候補、0.3秒以上なら発話交代とみなす閾値を設定する例。
相槌生成 (Backchannel)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1213語以上を体系的に整理しています
辞典トップへ