MTPLX 下载 Mac 版

MTPLX · Apple Silicon · v2.11.3

在 Mac 上,更快地运行 Qwen。

MTPLX 是为 Apple 芯片打造的本地大模型应用。它利用模型自身的多 Token 预测(MTP)能力加速生成,让你在 Mac 上聊天、写代码,也能为 OpenCode、Pi 和 Claude Code 提供本地推理服务。Qwen 3.8 Flash Next 在 M5 Max 的一次 OpenCode 请求中达到 125.8 tok/s。

macOS 14 及以上 · Apple 芯片 · 免费开源

按 Mac 内存选择模型

模型权重、上下文缓存和其他应用都会占用统一内存。下载大小与运行时内存占用不同。

统一内存模型适用场景
16 GB+Qwen 3.5 4B / 9B适合内存较小的 Mac。
32 GB+Qwen 3.8 27B Optimized Speed推荐用于本地编程和日常聊天。
36 GB+Qwen 3.8 27B Optimized Quality8-bit 版本,优先保留模型精度。
96 GB+Qwen 3.8 Flash Next适合大内存 Mac 上的编程任务。

长上下文需要额外内存。96 GB 是 Flash Next 的起步配置,并不代表能在这一配置下使用最大上下文。以下速度来自 M5 Max 128 GB,不能直接套用于所有 Mac。

Flash Next 实测生成速度

MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 统一内存,Optimized Speed。采样设置为 temperature 1.0、top-p 0.95、top-k 20。

任务tok/s测试条件
一次 OpenCode 请求125.8生成 1,301 个 Token;提示词 18,539 个 Token,其中 18,364 个命中缓存;MTP 深度 3。
约 9K Token 的代码提示词79.3生成 1,500 个 Token;同机交替测试。2.11.2 为 62.5 tok/s。
109K Token 的 OpenCode 轮次61.8两次测试的平均值。
200K Token 的后续轮次50.3缓存已预热,两次测试的平均值。

125.8 tok/s 是 2026 年 9 月 16 日一次请求的实测速度。实际速度随芯片、模型版本、上下文长度和缓存状态变化。

2.11.3 版本说明(英文)

安装并开始使用

  1. 下载 MTPLX,将应用放入“应用程序”文件夹并打开。
  2. 选择适合内存容量的 Qwen 模型包,等待下载完成。
  3. 启动本地服务,在应用内聊天,或连接自己的编程工具。

下载 Mac 版

如果使用 Homebrew,可在终端执行:

brew install youssofal/mtplx/mtplx
mtplx start

安装 OpenCode 后,可通过以下命令启动本地编程会话。MTPLX 也提供兼容 OpenAI 和 Anthropic 的接口。

mtplx start opencode

将 MTP 带到 Mac 的项目

Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。

MTP 登上 Mac 的历史(英文)

常见问题

在 Mac 上运行 Qwen,怎样才能更快?

使用支持模型原生 MTP 的推理引擎,选择适合内存的模型包。MTPLX 在 Apple 芯片上提供 MTP 加速,并发布按模型和上下文区分的测试结果。

MTPLX 免费吗?

MTPLX 免费开源,采用 Apache-2.0 许可证。各模型使用各自的许可证。

支持哪些 Mac?

MTPLX 支持运行 macOS 14 及以上系统的 Apple 芯片 Mac。模型选择取决于统一内存容量;M1 和 M2 用户可选择目录中相应的 FP16 兼容模型包。

数据与资料