Pipecatは、Daily, Inc.がコミュニティとともに開発する、音声とマルチモーダルの会話AIエージェントを作るためのオープンソースのフレームワークです。Pythonが動く環境ならどこでも使え、特定のAIベンダーに縛られない構成で音声エージェントを組めます。

主な機能

音声、映像、テキスト、画像を1本のパイプラインで扱い、各段階をフレーム単位で制御できます。音声認識、LLM、音声合成、画像認識のサービスは多数の連携先から選べ、多くの場合1行の変更で差し替えられます。処理はストリーミングで流れるため、ユーザーが話している途中から応答の準備を始められます。割り込みへの対応や話者交代の検出、会話の文脈管理も備え、決まった流れの会話には「Pipecat Flows」を使います。接続方式はWebRTC、SIP、電話回線(PSTN)に対応し、クライアントSDKやOpenTelemetryによる計測もあります。pipecat init コマンドでひな形を作り、コーディングエージェントと一緒に開発を始めることもできます。

実行環境と料金

フレームワーク自体は無料で、自社サーバーで動かせます。運用を任せたい場合はマネージドの「Pipecat Cloud」があり、音声エージェント向けのagent-1xは稼働1分あたり$0.01です。電話回線、録音、ノイズ除去などは別料金で、LLMなど外部サービスの費用は各社に直接支払います。自社のAWS、Azure、GCP環境に入れるPipecat Enterpriseもあります。

注意点

Pythonで実装する開発者向けで、資料は英語です。