MTPLX · Apple Silicon · v2.11.3
在 Mac 上高速執行 Qwen 3.8 Flash Next。
Qwen3.8-Flash-Next 是擁有 125B 參數的混合專家模型。MTPLX 保留它的原生 MTP 預測頭,以精確的推測解碼加速生成。適用於統一記憶體至少 96 GB 的 Mac,可連線 OpenCode 等開發工具。
macOS 14 及以上 · Apple 晶片 · 免費開源
Flash Next 實測生成速度
MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 統一記憶體,Optimized Speed。取樣設定為 temperature 1.0、top-p 0.95、top-k 20。
| 任務 | tok/s | 測試條件 |
|---|---|---|
| 一次 OpenCode 請求 | 125.8 | 生成 1,301 個 Token;提示詞 18,539 個 Token,其中 18,364 個命中快取;MTP 深度 3。 |
| 約 9K Token 的程式碼提示詞 | 79.3 | 生成 1,500 個 Token;同機交替測試。2.11.2 為 62.5 tok/s。 |
| 109K Token 的 OpenCode 輪次 | 61.8 | 兩次測試的平均值。 |
| 200K Token 的後續輪次 | 50.3 | 快取已預熱,兩次測試的平均值。 |
125.8 tok/s 是 2026 年 9 月 16 日一次請求的實測速度。實際速度隨晶片、模型版本、上下文長度和快取狀態變化。
2.11.3 版本說明(英文)模型版本與記憶體要求
推薦 Optimized Speed:採用動態 4-bit 量化,Qwen Sparse Attention 投影保留 8-bit 精度。Bare Speed 採用統一 4-bit 量化,更側重生成速度。
Optimized Speed 下載約 115.1 GB,其中包含從 SSD 讀取的 32 GB n-gram 表。常駐模型權重約 83 GB,還需為上下文和執行過程留出記憶體。Bare Speed 下載約 106.3 GB,常駐權重約 74 GB。
Hugging Face: Optimized Speed安裝並開始使用
- 下載 MTPLX,將應用放入“應用程式”資料夾並開啟。
- 選擇適合記憶體容量的 Qwen 模型包,等待下載完成。
- 啟動本機服務,在應用程式內聊天,或連線自己的開發工具。
如果使用 Homebrew,可在終端執行:
brew install youssofal/mtplx/mtplx
mtplx start安裝 OpenCode 後,可透過以下命令啟動本機程式設計會話。MTPLX 也提供相容 OpenAI 和 Anthropic 的介面。
mtplx start opencode將 MTP 帶到 Mac 的專案
Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。
常見問題
Flash Next 能在 32 GB Mac 上執行嗎?
當前 MTPLX 模型包面向至少 96 GB 記憶體的 Mac。32 GB Mac 建議選擇 Qwen 3.8 27B Optimized Speed。
Flash Next 和 Flash-Next 是同一個模型嗎?
是。本頁的 Flash Next 指 Qwen3.8-Flash-Next。模型倉庫名稱保留官方連字元寫法。