MTPLX · Apple Silicon · v2.11.3
如何在 Mac 上本地运行 Qwen。
先根据统一内存选择模型,再安装 MTPLX。你可以使用原生 Mac 应用,也可以通过 Homebrew 安装命令行工具。模型下载完成后,推理在自己的 Mac 上进行。
macOS 14 及以上 · Apple 芯片 · 免费开源
按 Mac 内存选择模型
模型权重、上下文缓存和其他应用都会占用统一内存。下载大小与运行时内存占用不同。
| 统一内存 | 模型 | 适用场景 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | 适合内存较小的 Mac。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | 推荐用于本地编程和日常聊天。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-bit 版本,优先保留模型精度。 |
| 96 GB+ | Qwen 3.8 Flash Next | 适合大内存 Mac 上的编程任务。 |
长上下文需要额外内存。96 GB 是 Flash Next 的起步配置,并不代表能在这一配置下使用最大上下文。以下速度来自 M5 Max 128 GB,不能直接套用于所有 Mac。
安装并开始使用
- 下载 MTPLX,将应用放入“应用程序”文件夹并打开。
- 选择适合内存容量的 Qwen 模型包,等待下载完成。
- 启动本地服务,在应用内聊天,或连接自己的编程工具。
如果使用 Homebrew,可在终端执行:
brew install youssofal/mtplx/mtplx
mtplx start安装 OpenCode 后,可通过以下命令启动本地编程会话。MTPLX 也提供兼容 OpenAI 和 Anthropic 的接口。
mtplx start opencode确认模型确实在本地运行
在 MTPLX 中检查已加载模型、生成速度和内存占用。服务默认运行在本机地址。模型下载需要联网,使用网页搜索或外部工具时,这些工具仍可能访问网络。
先完成一个真实任务,例如修改项目中的函数,再追加一个问题。既关注生成速度,也关注首个 Token 的等待时间,以及工具调用后的响应速度。
将 MTP 带到 Mac 的项目
Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。
常见问题
在 Mac 上运行 Qwen,怎样才能更快?
使用支持模型原生 MTP 的推理引擎,选择适合内存的模型包。MTPLX 在 Apple 芯片上提供 MTP 加速,并发布按模型和上下文区分的测试结果。
MTPLX 免费吗?
MTPLX 免费开源,采用 Apache-2.0 许可证。各模型使用各自的许可证。
支持哪些 Mac?
MTPLX 支持运行 macOS 14 及以上系统的 Apple 芯片 Mac。模型选择取决于统一内存容量;M1 和 M2 用户可选择目录中相应的 FP16 兼容模型包。