HeyGenの発表内容

HeyGenは2026年10月2日に、開発者向けに3つの新しい制作ツールを提供したと発表しました。自社サービスに対話型アバターや動画生成の機能を組み込めるように整備しています。

提供ツールの1つ目は、OpenAIの音声モデル「GPT-Live-1」と連携するリアルタイムアバターの基盤です。利用者が話しかけるとアバターが声で答え、画面に説明用の図を表示します。顧客対応や言語学習など3つの見本が、MITライセンス (商用利用しやすい無償の利用規約) で公開されています。

2つ目はKaggleと共同で公開した動画生成の評価基準「Code2Video Benchmark」です。168件の制作指示を基に、AIが指示通りに動く映像を作れているかを測定します。3つ目は、20分以上の録音データから高品質な合成音声を作成できるAPI (プログラムから外部サービスを呼び出す仕組み) です。

自社のWebサイトや業務システムに対話アバターを直接組み込めるようになります。画面を見せながら話す接客担当や研修講師のような機能を、最初から自作せずに短期間で導入できます。

つまり、どういうこと?

ざっくり言うと、画面に表示されるAIアバターに「身振り手振り付きで案内する受付係」の役割を与えられる部品セットです。これまでは文字や音声だけで返答していたAIに、身振りや資料提示を連動させる仕組みを、開発者がゼロから作らずにすぐ試せるようになりました。

編集部の見方

動画生成から対話体験へ。

動画編集画面のボタンを増やすのではなく、APIやオープンソースの提供に振り切った点に筆者は驚きました。音声に合わせて画面上のカードを切り替えるような実用的な連携は、自前で開発するとかなり手間がかかります。顧客対応を効率化したい人なら、今回のデモコードを土台に試す価値がありそうです。

ただ、映像の品質を測る評価基準で人間を上回ったモデルはまだありません。画面内で動くグラフィックの自然さは、人間並みになるまでもう少しかかりそうです。次は秋以降に各社から登場する新型マルチモーダルモデルが、この評価基準でどこまでスコアを伸ばすかを見届けたいところです。

誰に関係するか

自社サービスで対話型の顧客対応を自動化したい人は、画面操作と発話を同時にこなすAIアバターを自社システムへ手軽に導入できるようになります。

出典: HeyGen ↗