MTPLX 下載 Mac 版

MTPLX · Apple Silicon · v2.11.3

MTPLX 與 mlx-serve,誰在 Mac 上更快?

mlx-serve 公佈的同機測試給出了直接對比:在 M5 Max 上,MTPLX 在短提示詞和約 16K 上下文的精確解碼測試中均領先。以下保留原始測試條件,方便你選擇本機 Qwen 推論工具。

macOS 14 及以上 · Apple 晶片 · 免費開源

mlx-serve 公佈的 M5 Max 測試

來源為 mlx-serve v26.9.3 的 mtp-acceptance-port 文件。以下兩行均使用保持分佈精確的解碼模式。

推論引擎短提示詞約 16K 上下文
MTPLX102.0 tok/s90.9 tok/s
mlx-serve92.5 tok/s82.4 tok/s

MTPLX 在短提示詞上約快 10.3%,在約 16K 上下文上也約快 10.3%。

測試使用 temperature 1.0、top-p 0.95、MTP 深度 3,關閉思考,進行三次計時取樣。MTPLX 使用 PR #475 的構建。兩者模型包、KV 格式、取樣篩選順序和隨機流不同;結果代表這些具體配置。

mlx-serve 原始測試表(英文)

速度之外,還要看什麼?

精確推測解碼保持所載入模型的取樣分佈。它不消除量化造成的差異,因此對比時應同時檢視模型包、精度和記憶體需求。

MTPLX 將本機聊天、模型管理和開發工具連線整合到原生 Mac 應用程式中。125.8 tok/s 的 OpenCode 結果是另一次獨立測試,可在 Flash Next 頁面檢視完整條件。

將 MTP 帶到 Mac 的專案

Youssof Altoukhi 建立了 MTPLX,將原生多 Token 預測帶到 Mac。專案於 2026 年 4 月 27 日開始開發,首個公開版本於 5 月 2 日釋出。MTPLX 在 Apple 晶片上執行模型自身的 MTP 預測頭,並透過精確推測取樣加速本機生成。

MTP 登上 Mac 的歷史(英文)

常見問題

這是 MTPLX 自己測出的競品對比嗎?

不是。這張同機對比表由 mlx-serve 專案釋出,本頁列出原始來源和測試條件。

125.8 tok/s 能直接與表中的 92.5 比較嗎?

不能。這兩個數字來自不同任務和配置。同機比較應使用表中的 102.0 與 92.5,以及 90.9 與 82.4。

測試數據與參考資料