MTPLX · Apple Silicon · v2.11.3
MacのQwen 3.8 27Bで、ローカルのコード作業を。
Qwen 3.8 27Bは、32 GB以上のMacでコードを書く際に使いやすいモデルです。MTPLXはMTPヘッドを使って複数の候補トークンをまとめて検証し、生成の待ち時間を短縮します。通常はOptimized Speedを推奨します。
macOS 14以降 · Appleシリコン · 無料・オープンソース
Macのメモリに合うモデルを選ぶ
モデルの重み、コンテキストのキャッシュ、ほかのアプリが同じメモリを使います。ダウンロード容量と実行時のメモリ使用量は異なります。
| ユニファイドメモリ | モデル | 用途 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | メモリ容量が少ないMac向け。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | コード作成や日常のチャットに推奨。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | モデルの精度を重視する8-bit版。 |
| 96 GB+ | Qwen 3.8 Flash Next | 大容量メモリのMacで行うコード作業向け。 |
長いコンテキストには追加のメモリが必要です。96 GBはFlash Nextの最小構成であり、最大コンテキストを使える保証ではありません。掲載速度はM5 Max、128 GBでの測定値です。
27Bの生成速度とモデルの選択
以下はM5 Maxで異なるタスクを実行した測定値です。直前に生成したファイルの書き直しでは既存の内容を再利用できるため、新しい内容の生成とは条件が異なります。
| 処理内容 | tok/s | 測定条件 |
|---|---|---|
| 直前に生成したファイルの書き直し | 87.6 | Optimized Speed · MTPLX 2.10.0 |
| 新しいコード作成タスク | 65.2 | Bare Speed · MTPLX 2.7.0 |
| 新しいコード作成タスク | 58.7 | Optimized Speed · MTPLX 2.7.0 |
Qwen 3.6 27Bには別の記録があります。2026年7月2日、192トークンのコードテストで81.74 tok/sを記録しました。temperature 0.6、MTP深度3で、同じ条件の通常デコードは30.37 tok/s。速度は2.69倍です。この記録の対象はQwen 3.6 27Bです。
81.74 tok/sの測定ログインストールして使い始める
- MTPLXをダウンロードし、アプリケーションフォルダに移動して開きます。
- メモリ容量に合ったQwenモデルを選び、ダウンロードを完了させます。
- ローカルサーバーを起動し、アプリ内でチャットするか、開発ツールを接続します。
Homebrewを使う場合は、ターミナルで次のコマンドを実行します。
brew install youssofal/mtplx/mtplx
mtplx startOpenCodeをインストール済みなら、次のコマンドでローカルのコード作業を始められます。MTPLXはOpenAI互換・Anthropic互換APIも提供します。
mtplx start opencodeMTPをMacにもたらしたプロジェクト
Youssof AltoukhiはMTPLXを開発し、ネイティブのマルチトークン予測をMacにもたらしました。開発は2026年4月27日に始まり、5月2日に最初の公開版をリリースしました。MTPLXはAppleシリコン上でモデル自身のMTPヘッドを実行し、精確な投機的サンプリングでローカル生成を高速化します。
よくある質問
Qwen 3.8 27Bはどのモデルパッケージを選べばよいですか?
32 GB以上ではOptimized Speedを推奨します。精度を優先する場合は、36 GB以上で8-bitのOptimized Qualityを選べます。
MTPはサンプリング分布を変えますか?
MTPLXは確率比による受理と残差補正を使い、読み込んだモデルのサンプリング分布を保ちます。量子化による精度の違いは、選んだモデルパッケージに依存します。