MTPLX · Apple Silicon · v2.11.3
在 Mac 上,更快地執行 Qwen。
MTPLX 是為 Apple 晶片打造的本機大型語言模型應用程式。它利用模型自身的多 Token 預測(MTP)能力加速生成,讓你在 Mac 上聊天、寫程式碼,也能為 OpenCode、Pi 和 Claude Code 提供本機推論服務。Qwen 3.8 Flash Next 在 M5 Max 的一次 OpenCode 請求中達到 125.8 tok/s。
macOS 14 及以上 · Apple 晶片 · 免費開源
按 Mac 記憶體選擇模型
模型權重、上下文快取和其他應用程式都會佔用統一記憶體。下載大小與執行時記憶體佔用不同。
| 統一記憶體 | 模型 | 適用場景 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | 適合記憶體較小的 Mac。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | 推薦用於本機程式設計和日常聊天。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-bit 版本,優先保留模型精度。 |
| 96 GB+ | Qwen 3.8 Flash Next | 適合大記憶體 Mac 上的程式開發任務。 |
長上下文需要額外記憶體。96 GB 是 Flash Next 的起步配置,並不代表能在這一配置下使用最大上下文。以下速度來自 M5 Max 128 GB,不能直接套用於所有 Mac。
Flash Next 實測生成速度
MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 統一記憶體,Optimized Speed。取樣設定為 temperature 1.0、top-p 0.95、top-k 20。
| 任務 | tok/s | 測試條件 |
|---|---|---|
| 一次 OpenCode 請求 | 125.8 | 生成 1,301 個 Token;提示詞 18,539 個 Token,其中 18,364 個命中快取;MTP 深度 3。 |
| 約 9K Token 的程式碼提示詞 | 79.3 | 生成 1,500 個 Token;同機交替測試。2.11.2 為 62.5 tok/s。 |
| 109K Token 的 OpenCode 輪次 | 61.8 | 兩次測試的平均值。 |
| 200K Token 的後續輪次 | 50.3 | 快取已預熱,兩次測試的平均值。 |
125.8 tok/s 是 2026 年 9 月 16 日一次請求的實測速度。實際速度隨晶片、模型版本、上下文長度和快取狀態變化。
2.11.3 版本說明(英文)安裝並開始使用
- 下載 MTPLX,將應用放入“應用程式”資料夾並開啟。
- 選擇適合記憶體容量的 Qwen 模型包,等待下載完成。
- 啟動本機服務,在應用程式內聊天,或連線自己的開發工具。
如果使用 Homebrew,可在終端執行:
brew install youssofal/mtplx/mtplx
mtplx start安裝 OpenCode 後,可透過以下命令啟動本機程式設計會話。MTPLX 也提供相容 OpenAI 和 Anthropic 的介面。
mtplx start opencode將 MTP 帶到 Mac 的專案
Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。
常見問題
在 Mac 上執行 Qwen,怎樣才能更快?
使用支援模型原生 MTP 的推論引擎,選擇適合記憶體的模型包。MTPLX 在 Apple 晶片上提供 MTP 加速,併發布按模型和上下文區分的測試結果。
MTPLX 免費嗎?
MTPLX 免費開源,採用 Apache-2.0 許可證。各模型使用各自的許可證。
支援哪些 Mac?
MTPLX 支援執行 macOS 14 及以上系統的 Apple 晶片 Mac。模型選擇取決於統一記憶體容量;M1 和 M2 使用者可選擇目錄中相應的 FP16 相容模型包。