MTPLX Mac版をダウンロード

MTPLX · Apple Silicon · v2.11.3

MacでQwenを、もっと速く。

MTPLXは、Appleシリコン向けのローカルLLMアプリです。モデル自身のマルチトークン予測(MTP)を使い、文章やコードの生成を高速化します。アプリ内のチャットに加え、OpenCode、Pi、Claude CodeからもMac上のモデルを利用できます。Qwen 3.8 Flash Nextは、M5 Maxでの1件のOpenCodeリクエストで125.8 tok/sを記録しました。

macOS 14以降 · Appleシリコン · 無料・オープンソース

Macのメモリに合うモデルを選ぶ

モデルの重み、コンテキストのキャッシュ、ほかのアプリが同じメモリを使います。ダウンロード容量と実行時のメモリ使用量は異なります。

ユニファイドメモリモデル用途
16 GB+Qwen 3.5 4B / 9Bメモリ容量が少ないMac向け。
32 GB+Qwen 3.8 27B Optimized Speedコード作成や日常のチャットに推奨。
36 GB+Qwen 3.8 27B Optimized Qualityモデルの精度を重視する8-bit版。
96 GB+Qwen 3.8 Flash Next大容量メモリのMacで行うコード作業向け。

長いコンテキストには追加のメモリが必要です。96 GBはFlash Nextの最小構成であり、最大コンテキストを使える保証ではありません。掲載速度はM5 Max、128 GBでの測定値です。

Flash Nextの実測生成速度

MTPLX 2.11.3、MacBook Pro M5 Max、128 GB、Optimized Speed。temperature 1.0、top-p 0.95、top-k 20で測定。

処理内容tok/s測定条件
1件のOpenCodeリクエスト125.81,301トークンを生成。プロンプトは18,539トークンで、18,364トークンをキャッシュから再利用。MTP深度3。
約9Kトークンのコードプロンプト79.31,500トークンを生成。同一Macで交互に測定。2.11.2では62.5 tok/s。
109KトークンのOpenCodeターン61.82回の測定の平均。
200Kトークンの続きのターン50.3キャッシュが温まった状態で、2回の測定の平均。

125.8 tok/sは2026年9月16日の単一リクエストの結果です。実際の速度はチップ、モデルの種類、コンテキスト長、キャッシュの状態によって変わります。

2.11.3のリリースノート(英語)

インストールして使い始める

  1. MTPLXをダウンロードし、アプリケーションフォルダに移動して開きます。
  2. メモリ容量に合ったQwenモデルを選び、ダウンロードを完了させます。
  3. ローカルサーバーを起動し、アプリ内でチャットするか、開発ツールを接続します。

Mac版をダウンロード

Homebrewを使う場合は、ターミナルで次のコマンドを実行します。

brew install youssofal/mtplx/mtplx
mtplx start

OpenCodeをインストール済みなら、次のコマンドでローカルのコード作業を始められます。MTPLXはOpenAI互換・Anthropic互換APIも提供します。

mtplx start opencode

MTPをMacにもたらしたプロジェクト

Youssof AltoukhiはMTPLXを開発し、ネイティブのマルチトークン予測をMacにもたらしました。開発は2026年4月27日に始まり、5月2日に最初の公開版をリリースしました。MTPLXはAppleシリコン上でモデル自身のMTPヘッドを実行し、精確な投機的サンプリングでローカル生成を高速化します。

MacにMTPを実装した開発の歴史(英語)

よくある質問

MacでQwenを高速に動かすには?

モデルのネイティブMTPに対応するエンジンと、メモリ容量に合うモデルを選びます。MTPLXはAppleシリコンでMTPを利用し、モデルとコンテキスト長ごとの測定結果を公開しています。

MTPLXは無料ですか?

MTPLXは無料のオープンソースソフトウェアで、Apache-2.0ライセンスを採用しています。モデルにはそれぞれのライセンスが適用されます。

どのMacに対応していますか?

macOS 14以降を搭載したAppleシリコンのMacに対応しています。使えるモデルはメモリ容量によって異なります。M1とM2向けには、対応するFP16モデルパッケージを用意しています。

測定データと参考資料