MTPLX · Apple Silicon · v2.11.3
MacでQwenを、もっと速く。
MTPLXは、Appleシリコン向けのローカルLLMアプリです。モデル自身のマルチトークン予測(MTP)を使い、文章やコードの生成を高速化します。アプリ内のチャットに加え、OpenCode、Pi、Claude CodeからもMac上のモデルを利用できます。Qwen 3.8 Flash Nextは、M5 Maxでの1件のOpenCodeリクエストで125.8 tok/sを記録しました。
macOS 14以降 · Appleシリコン · 無料・オープンソース
Macのメモリに合うモデルを選ぶ
モデルの重み、コンテキストのキャッシュ、ほかのアプリが同じメモリを使います。ダウンロード容量と実行時のメモリ使用量は異なります。
| ユニファイドメモリ | モデル | 用途 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | メモリ容量が少ないMac向け。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | コード作成や日常のチャットに推奨。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | モデルの精度を重視する8-bit版。 |
| 96 GB+ | Qwen 3.8 Flash Next | 大容量メモリのMacで行うコード作業向け。 |
長いコンテキストには追加のメモリが必要です。96 GBはFlash Nextの最小構成であり、最大コンテキストを使える保証ではありません。掲載速度はM5 Max、128 GBでの測定値です。
Flash Nextの実測生成速度
MTPLX 2.11.3、MacBook Pro M5 Max、128 GB、Optimized Speed。temperature 1.0、top-p 0.95、top-k 20で測定。
| 処理内容 | tok/s | 測定条件 |
|---|---|---|
| 1件のOpenCodeリクエスト | 125.8 | 1,301トークンを生成。プロンプトは18,539トークンで、18,364トークンをキャッシュから再利用。MTP深度3。 |
| 約9Kトークンのコードプロンプト | 79.3 | 1,500トークンを生成。同一Macで交互に測定。2.11.2では62.5 tok/s。 |
| 109KトークンのOpenCodeターン | 61.8 | 2回の測定の平均。 |
| 200Kトークンの続きのターン | 50.3 | キャッシュが温まった状態で、2回の測定の平均。 |
125.8 tok/sは2026年9月16日の単一リクエストの結果です。実際の速度はチップ、モデルの種類、コンテキスト長、キャッシュの状態によって変わります。
2.11.3のリリースノート(英語)インストールして使い始める
- MTPLXをダウンロードし、アプリケーションフォルダに移動して開きます。
- メモリ容量に合ったQwenモデルを選び、ダウンロードを完了させます。
- ローカルサーバーを起動し、アプリ内でチャットするか、開発ツールを接続します。
Homebrewを使う場合は、ターミナルで次のコマンドを実行します。
brew install youssofal/mtplx/mtplx
mtplx startOpenCodeをインストール済みなら、次のコマンドでローカルのコード作業を始められます。MTPLXはOpenAI互換・Anthropic互換APIも提供します。
mtplx start opencodeMTPをMacにもたらしたプロジェクト
Youssof AltoukhiはMTPLXを開発し、ネイティブのマルチトークン予測をMacにもたらしました。開発は2026年4月27日に始まり、5月2日に最初の公開版をリリースしました。MTPLXはAppleシリコン上でモデル自身のMTPヘッドを実行し、精確な投機的サンプリングでローカル生成を高速化します。
よくある質問
MacでQwenを高速に動かすには?
モデルのネイティブMTPに対応するエンジンと、メモリ容量に合うモデルを選びます。MTPLXはAppleシリコンでMTPを利用し、モデルとコンテキスト長ごとの測定結果を公開しています。
MTPLXは無料ですか?
MTPLXは無料のオープンソースソフトウェアで、Apache-2.0ライセンスを採用しています。モデルにはそれぞれのライセンスが適用されます。
どのMacに対応していますか?
macOS 14以降を搭載したAppleシリコンのMacに対応しています。使えるモデルはメモリ容量によって異なります。M1とM2向けには、対応するFP16モデルパッケージを用意しています。