MTPLX · Apple Silicon · v2.11.3
如何在 Mac 上本機執行 Qwen。
先根據統一記憶體選擇模型,再安裝 MTPLX。你可以使用原生 Mac 應用程式,也可以透過 Homebrew 安裝命令列工具。模型下載完成後,推論在自己的 Mac 上進行。
macOS 14 及以上 · Apple 晶片 · 免費開源
按 Mac 記憶體選擇模型
模型權重、上下文快取和其他應用程式都會佔用統一記憶體。下載大小與執行時記憶體佔用不同。
| 統一記憶體 | 模型 | 適用場景 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | 適合記憶體較小的 Mac。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | 推薦用於本機程式設計和日常聊天。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-bit 版本,優先保留模型精度。 |
| 96 GB+ | Qwen 3.8 Flash Next | 適合大記憶體 Mac 上的程式開發任務。 |
長上下文需要額外記憶體。96 GB 是 Flash Next 的起步配置,並不代表能在這一配置下使用最大上下文。以下速度來自 M5 Max 128 GB,不能直接套用於所有 Mac。
安裝並開始使用
- 下載 MTPLX,將應用放入“應用程式”資料夾並開啟。
- 選擇適合記憶體容量的 Qwen 模型包,等待下載完成。
- 啟動本機服務,在應用程式內聊天,或連線自己的開發工具。
如果使用 Homebrew,可在終端執行:
brew install youssofal/mtplx/mtplx
mtplx start安裝 OpenCode 後,可透過以下命令啟動本機程式設計會話。MTPLX 也提供相容 OpenAI 和 Anthropic 的介面。
mtplx start opencode確認模型確實在本機執行
在 MTPLX 中檢查已載入模型、生成速度和記憶體佔用。服務預設執行在本機地址。模型下載需要聯網,使用網頁搜尋或外部工具時,這些工具仍可能訪問網路。
先完成一個真實任務,例如修改專案中的函式,再追加一個問題。既關注生成速度,也關注首個 Token 的等待時間,以及工具呼叫後的響應速度。
將 MTP 帶到 Mac 的專案
Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。
常見問題
在 Mac 上執行 Qwen,怎樣才能更快?
使用支援模型原生 MTP 的推論引擎,選擇適合記憶體的模型包。MTPLX 在 Apple 晶片上提供 MTP 加速,併發布按模型和上下文區分的測試結果。
MTPLX 免費嗎?
MTPLX 免費開源,採用 Apache-2.0 許可證。各模型使用各自的許可證。
支援哪些 Mac?
MTPLX 支援執行 macOS 14 及以上系統的 Apple 晶片 Mac。模型選擇取決於統一記憶體容量;M1 和 M2 使用者可選擇目錄中相應的 FP16 相容模型包。