FramePackは、lllyasviel が公開している、画像から動画を生成するためのオープンソースのデスクトップソフトです。論文「Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models」の公式実装で、GitHubのリポジトリがそのまま配布元になっています。
主な機能
画面左で画像をアップロードしてプロンプトを書くと、右側に生成中の動画と次の区間の潜在プレビューが表示されます。次のフレーム(区間)を順番に予測していく方式のため、動画は少しずつ長くなり、完成前から途中経過を確認できます。入力の文脈を一定の長さに圧縮する仕組みにより、動画が長くなっても計算負荷が変わらず、13Bモデルで30fps・60秒(1800フレーム)の動画を最小6GBのGPUメモリで生成できるとされています。TeaCacheによる高速化や、xformers・flash-attn・sage-attentionなどのアテンションカーネルにも対応します。
向いている使い方
イラストや写真に動きを付けたい個人クリエイター、素材をクラウドの動画生成サービスにアップロードしたくない人、ノートPCのGPUで長めの動画を試したい人に向きます。
料金と導入
ソフトは無料です。WindowsはCUDA 12.6とPyTorch 2.6を同梱したワンクリックパッケージを解凍し、update.batで更新してからrun.batで起動します。LinuxはPython 3.10の環境に依存パッケージを入れてdemo_gradio.pyを実行します。初回はHuggingFaceから30GB以上のモデルが自動でダウンロードされます。
注意点
動作にはfp16とbf16に対応したNVIDIAのRTX 30XX・40XX・50XXシリーズが必要で、GTX 10XX・20XXは未検証です。RTX 4090のデスクトップでも1フレームあたり1.5〜2.5秒かかり、ノートPCのGPUではその4〜8倍ほど遅くなります。公式はGitHubリポジトリが唯一の公式サイトでWebサービスは提供していないと明言しており、framepack.aiなどの類似ドメインは偽サイトとして注意を呼びかけています。


