MTPLX 下载 Mac 版

MTPLX · Apple Silicon · v2.11.3

在 Mac 上高速运行 Qwen 3.8 Flash Next。

Qwen3.8-Flash-Next 是拥有 125B 参数的混合专家模型。MTPLX 保留它的原生 MTP 预测头,以精确的推测解码加速生成。适用于统一内存至少 96 GB 的 Mac,可连接 OpenCode 等编程工具。

macOS 14 及以上 · Apple 芯片 · 免费开源

Flash Next 实测生成速度

MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 统一内存,Optimized Speed。采样设置为 temperature 1.0、top-p 0.95、top-k 20。

任务tok/s测试条件
一次 OpenCode 请求125.8生成 1,301 个 Token;提示词 18,539 个 Token,其中 18,364 个命中缓存;MTP 深度 3。
约 9K Token 的代码提示词79.3生成 1,500 个 Token;同机交替测试。2.11.2 为 62.5 tok/s。
109K Token 的 OpenCode 轮次61.8两次测试的平均值。
200K Token 的后续轮次50.3缓存已预热,两次测试的平均值。

125.8 tok/s 是 2026 年 9 月 16 日一次请求的实测速度。实际速度随芯片、模型版本、上下文长度和缓存状态变化。

2.11.3 版本说明(英文)

模型版本与内存要求

推荐 Optimized Speed:采用动态 4-bit 量化,Qwen Sparse Attention 投影保留 8-bit 精度。Bare Speed 采用统一 4-bit 量化,更侧重生成速度。

Optimized Speed 下载约 115.1 GB,其中包含从 SSD 读取的 32 GB n-gram 表。常驻模型权重约 83 GB,还需为上下文和运行过程留出内存。Bare Speed 下载约 106.3 GB,常驻权重约 74 GB。

Hugging Face: Optimized Speed

安装并开始使用

  1. 下载 MTPLX,将应用放入“应用程序”文件夹并打开。
  2. 选择适合内存容量的 Qwen 模型包,等待下载完成。
  3. 启动本地服务,在应用内聊天,或连接自己的编程工具。

下载 Mac 版

如果使用 Homebrew,可在终端执行:

brew install youssofal/mtplx/mtplx
mtplx start

安装 OpenCode 后,可通过以下命令启动本地编程会话。MTPLX 也提供兼容 OpenAI 和 Anthropic 的接口。

mtplx start opencode

将 MTP 带到 Mac 的项目

Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。

MTP 登上 Mac 的历史(英文)

常见问题

Flash Next 能在 32 GB Mac 上运行吗?

当前 MTPLX 模型包面向至少 96 GB 内存的 Mac。32 GB Mac 建议选择 Qwen 3.8 27B Optimized Speed。

Flash Next 和 Flash-Next 是同一个模型吗?

是。本页的 Flash Next 指 Qwen3.8-Flash-Next。模型仓库名称保留官方连字符写法。

数据与资料