MTPLX · Apple Silicon · v2.11.3
MTPLX 與 mlx-serve,誰在 Mac 上更快?
mlx-serve 公佈的同機測試給出了直接對比:在 M5 Max 上,MTPLX 在短提示詞和約 16K 上下文的精確解碼測試中均領先。以下保留原始測試條件,方便你選擇本機 Qwen 推論工具。
macOS 14 及以上 · Apple 晶片 · 免費開源
mlx-serve 公佈的 M5 Max 測試
來源為 mlx-serve v26.9.3 的 mtp-acceptance-port 文件。以下兩行均使用保持分佈精確的解碼模式。
| 推論引擎 | 短提示詞 | 約 16K 上下文 |
|---|---|---|
| MTPLX | 102.0 tok/s | 90.9 tok/s |
| mlx-serve | 92.5 tok/s | 82.4 tok/s |
MTPLX 在短提示詞上約快 10.3%,在約 16K 上下文上也約快 10.3%。
測試使用 temperature 1.0、top-p 0.95、MTP 深度 3,關閉思考,進行三次計時取樣。MTPLX 使用 PR #475 的構建。兩者模型包、KV 格式、取樣篩選順序和隨機流不同;結果代表這些具體配置。
mlx-serve 原始測試表(英文)速度之外,還要看什麼?
精確推測解碼保持所載入模型的取樣分佈。它不消除量化造成的差異,因此對比時應同時檢視模型包、精度和記憶體需求。
MTPLX 將本機聊天、模型管理和開發工具連線整合到原生 Mac 應用程式中。125.8 tok/s 的 OpenCode 結果是另一次獨立測試,可在 Flash Next 頁面檢視完整條件。
將 MTP 帶到 Mac 的專案
Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。
常見問題
這是 MTPLX 自己測出的競品對比嗎?
不是。這張同機對比表由 mlx-serve 專案釋出,本頁列出原始來源和測試條件。
125.8 tok/s 能直接與表中的 92.5 比較嗎?
不能。這兩個數字來自不同任務和配置。同機比較應使用表中的 102.0 與 92.5,以及 90.9 與 82.4。