MTPLX 下载 Mac 版

MTPLX · Apple Silicon · v2.11.3

MTPLX 与 mlx-serve,谁在 Mac 上更快?

mlx-serve 公布的同机测试给出了直接对比:在 M5 Max 上,MTPLX 在短提示词和约 16K 上下文的精确解码测试中均领先。以下保留原始测试条件,方便你选择本地 Qwen 推理工具。

macOS 14 及以上 · Apple 芯片 · 免费开源

mlx-serve 公布的 M5 Max 测试

来源为 mlx-serve v26.9.3 的 mtp-acceptance-port 文档。以下两行均使用保持分布精确的解码模式。

推理引擎短提示词约 16K 上下文
MTPLX102.0 tok/s90.9 tok/s
mlx-serve92.5 tok/s82.4 tok/s

MTPLX 在短提示词上约快 10.3%,在约 16K 上下文上也约快 10.3%。

测试使用 temperature 1.0、top-p 0.95、MTP 深度 3,关闭思考,进行三次计时采样。MTPLX 使用 PR #475 的构建。两者模型包、KV 格式、采样过滤顺序和随机流不同;结果代表这些具体配置。

mlx-serve 原始测试表(英文)

速度之外,还要看什么?

精确推测解码保持所加载模型的采样分布。它不消除量化造成的差异,因此对比时应同时查看模型包、精度和内存需求。

MTPLX 将本地聊天、模型管理和编程工具连接整合到原生 Mac 应用中。125.8 tok/s 的 OpenCode 结果是另一次独立测试,可在 Flash Next 页面查看完整条件。

将 MTP 带到 Mac 的项目

Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。

MTP 登上 Mac 的历史(英文)

常见问题

这是 MTPLX 自己测出的竞品对比吗?

不是。这张同机对比表由 mlx-serve 项目发布,本页列出原始来源和测试条件。

125.8 tok/s 能直接与表中的 92.5 比较吗?

不能。这两个数字来自不同任务和配置。同机比较应使用表中的 102.0 与 92.5,以及 90.9 与 82.4。

数据与资料