MTPLX · Apple Silicon · v2.11.3
在 Mac 上用 Qwen 3.8 27B 写代码。
Qwen 3.8 27B 是 32 GB 及以上 Mac 的实用编程选择。MTPLX 保留模型的 MTP 预测头,一次验证多个候选 Token,减少生成等待。Optimized Speed 是默认推荐的模型版本。
macOS 14 及以上 · Apple 芯片 · 免费开源
按 Mac 内存选择模型
模型权重、上下文缓存和其他应用都会占用统一内存。下载大小与运行时内存占用不同。
| 统一内存 | 模型 | 适用场景 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | 适合内存较小的 Mac。 |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | 推荐用于本地编程和日常聊天。 |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-bit 版本,优先保留模型精度。 |
| 96 GB+ | Qwen 3.8 Flash Next | 适合大内存 Mac 上的编程任务。 |
长上下文需要额外内存。96 GB 是 Flash Next 的起步配置,并不代表能在这一配置下使用最大上下文。以下速度来自 M5 Max 128 GB,不能直接套用于所有 Mac。
27B 的速度与模型选择
以下为 M5 Max 上不同任务的实测结果。文件改写可利用已存在的内容,不能当作全新生成的速度。
| 任务 | tok/s | 测试条件 |
|---|---|---|
| 改写刚刚生成的文件 | 87.6 | Optimized Speed · MTPLX 2.10.0 |
| 新编程任务 | 65.2 | Bare Speed · MTPLX 2.7.0 |
| 新编程任务 | 58.7 | Optimized Speed · MTPLX 2.7.0 |
另一个已记录的成绩是 Qwen 3.6 27B 的 81.74 tok/s:2026 年 7 月 2 日,192 Token 编程测试,temperature 0.6,MTP 深度 3。同一测试的普通解码为 30.37 tok/s,提升至 2.69 倍。这一成绩属于 Qwen 3.6 27B。
81.74 tok/s 原始测试日志安装并开始使用
- 下载 MTPLX,将应用放入“应用程序”文件夹并打开。
- 选择适合内存容量的 Qwen 模型包,等待下载完成。
- 启动本地服务,在应用内聊天,或连接自己的编程工具。
如果使用 Homebrew,可在终端执行:
brew install youssofal/mtplx/mtplx
mtplx start安装 OpenCode 后,可通过以下命令启动本地编程会话。MTPLX 也提供兼容 OpenAI 和 Anthropic 的接口。
mtplx start opencode将 MTP 带到 Mac 的项目
Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。
常见问题
应该选哪种 Qwen 3.8 27B 模型包?
32 GB 及以上的 Mac 推荐 Optimized Speed。更看重精度且有至少 36 GB 内存时,可选择 8-bit Optimized Quality。
MTP 会改变模型的采样分布吗?
MTPLX 使用概率比接受和残差校正,保持所加载模型的采样分布。量化精度仍由所选模型包决定。