MTPLX 下載 Mac 版

MTPLX · Apple Silicon · v2.11.3

在 Mac 上高速執行 Qwen 3.8 Flash Next。

Qwen3.8-Flash-Next 是擁有 125B 參數的混合專家模型。MTPLX 保留它的原生 MTP 預測頭,以精確的推測解碼加速生成。適用於統一記憶體至少 96 GB 的 Mac,可連線 OpenCode 等開發工具。

macOS 14 及以上 · Apple 晶片 · 免費開源

Flash Next 實測生成速度

MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 統一記憶體,Optimized Speed。取樣設定為 temperature 1.0、top-p 0.95、top-k 20。

任務tok/s測試條件
一次 OpenCode 請求125.8生成 1,301 個 Token;提示詞 18,539 個 Token,其中 18,364 個命中快取;MTP 深度 3。
約 9K Token 的程式碼提示詞79.3生成 1,500 個 Token;同機交替測試。2.11.2 為 62.5 tok/s。
109K Token 的 OpenCode 輪次61.8兩次測試的平均值。
200K Token 的後續輪次50.3快取已預熱,兩次測試的平均值。

125.8 tok/s 是 2026 年 9 月 16 日一次請求的實測速度。實際速度隨晶片、模型版本、上下文長度和快取狀態變化。

2.11.3 版本說明(英文)

模型版本與記憶體要求

推薦 Optimized Speed:採用動態 4-bit 量化,Qwen Sparse Attention 投影保留 8-bit 精度。Bare Speed 採用統一 4-bit 量化,更側重生成速度。

Optimized Speed 下載約 115.1 GB,其中包含從 SSD 讀取的 32 GB n-gram 表。常駐模型權重約 83 GB,還需為上下文和執行過程留出記憶體。Bare Speed 下載約 106.3 GB,常駐權重約 74 GB。

Hugging Face: Optimized Speed

安裝並開始使用

  1. 下載 MTPLX,將應用放入“應用程式”資料夾並開啟。
  2. 選擇適合記憶體容量的 Qwen 模型包,等待下載完成。
  3. 啟動本機服務,在應用程式內聊天,或連線自己的開發工具。

下載 Mac 版

如果使用 Homebrew,可在終端執行:

brew install youssofal/mtplx/mtplx
mtplx start

安裝 OpenCode 後,可透過以下命令啟動本機程式設計會話。MTPLX 也提供相容 OpenAI 和 Anthropic 的介面。

mtplx start opencode

將 MTP 帶到 Mac 的專案

Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。

MTP 登上 Mac 的歷史(英文)

常見問題

Flash Next 能在 32 GB Mac 上執行嗎?

當前 MTPLX 模型包面向至少 96 GB 記憶體的 Mac。32 GB Mac 建議選擇 Qwen 3.8 27B Optimized Speed。

Flash Next 和 Flash-Next 是同一個模型嗎?

是。本頁的 Flash Next 指 Qwen3.8-Flash-Next。模型倉庫名稱保留官方連字元寫法。

測試數據與參考資料