AI PICKS
新機能Perplexity Blog公式発表54分前

Perplexity、Apple Silicon向けローカル推論を最適化 MLX-LM比でdecode 1.35倍

結論(先に3行)
  1. PerplexityがApple Silicon向け推論エンジンを説明しました。
  2. Qwen3.6-35B-A3Bに特化したLilyの最適化です。
  3. 平均でprefill 1.23倍、decode 1.35倍を示しました。

Perplexityは、Apple SiliconとQwen3.6-35B-A3Bに特化した軽量ローカル推論エンジン「Lily」の最適化内容を公開しました。Hybrid Computeでは、クラウドモデルが調査や推論を担い、Mac上のローカルモデルが非公開ファイルやアプリを扱います。

Lilyは、Rustランタイムがモデルチェックポイント、セッション状態、生成ループを管理します。OpenAI互換のchat-completions APIでリクエストを受け、トークンをストリーミングします。実行経路にはPyTorchもMLXも含まれません。

Perplexityは、M5 Max、40コアGPU、128 GBユニファイドメモリのMacBook Proでベンチマークしました。256から128K tokensまでの10種類の長さで測定し、LilyはMLX-LM比でprefill平均1.23倍、decode平均1.35倍でした。

4K-token promptと4K-token decode contextでは、Lilyはprefill 5,749.9 tokens per second、decode 186.6 tokens per secondに達しました。MLX-LMはそれぞれ4,737.5、140.9でした。複数ターンのセッションでは、モデル呼び出しごとに時間短縮が積み重なります。

誰に関係するか

Mac上でPerplexityのローカル推論を使う開発者や、Apple SiliconでQwen系モデルを動かす利用者に関係します。

出典: Perplexity Blog

このニュースのツールAIリサーチ
Perplexity icon
Perplexity3.85最低料金¥0〜AI検索リサーチ出典付き
関連ニュースニュース一覧 >
法人の方へPerplexityの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。