Tavusの発表内容
米国のAI企業Tavusは、対面対話に特化したAIモデル「Griffin」を2026年10月1日に発表しました。音声の認識から映像の生成までを1つの仕組みでリアルタイムに処理します。
実際の対話実験では、参加者の48%が本物の人間と話したと判断しました。従来のシステムにおける同様の正答率は最大2%にとどまっていました。利用者の表情や声の調子、会話の合間を読み取りながら応答します。
相手の発話を聞きながら相づちを打つ動作や、話の途中で割り込まれた際に発話を止める処理に対応します。文字起こしや回答生成を複数のシステムで中継する従来の方式と比べ、遅延や非言語情報の欠落を抑えています。
今回は先行テスト版の「Griffin-Lite」を一部の利用者に公開しました。今後はより高性能なモデルを広く提供する計画で、ビデオ通話による顧客対応などの自然さを高められます。
つまり、どういうこと?
ひらたく言うと、これまでのAIアバターが台本を順番に読み上げる受付係だったのに対し、相手の表情や相づちを見ながら話せる店員へと進化した形です。
これまでは相手が話し終わるのを待ってから返答を考えていましたが、今回は話を聞きながら同時に相づちを打ったり表情を変えたりできます。
編集部の見方

従来の2%から48%へ跳ね上がったという実験結果には、筆者もかなり驚かされました。相手の話が終わるのを待たずに相づちを挟む挙動は、画面越しの対話で感じる違和感を大きく減らしてくれると思います。
機械的な間(ま)の解消。
ただ、今回は一部の開発者向けテストにとどまるため、日常の業務ツールとして手軽に試せる段階ではありません。複数の処理を中継して遅延が生じていた従来の構成と比べ、動画同士を直接つなぐアプローチがどこまで実務に耐えうるのかは気になるところです。まずは一般公開が予告された上位モデルの登場時期と、日本語環境でどれだけ自然に動くかを確かめたいところです。
誰に関係するか
AIを活用したビデオ通話や対面サポートを導入している人は、相づちや表情の変化を交えた自然なやり取りを顧客に提供できるようになります。


