MTPLX · Apple Silicon · v2.11.3
在 Mac 上高速运行 Qwen 3.8 Flash Next。
Qwen3.8-Flash-Next 是拥有 125B 参数的混合专家模型。MTPLX 保留它的原生 MTP 预测头,以精确的推测解码加速生成。适用于统一内存至少 96 GB 的 Mac,可连接 OpenCode 等编程工具。
macOS 14 及以上 · Apple 芯片 · 免费开源
Flash Next 实测生成速度
MTPLX 2.11.3,MacBook Pro M5 Max,128 GB 统一内存,Optimized Speed。采样设置为 temperature 1.0、top-p 0.95、top-k 20。
| 任务 | tok/s | 测试条件 |
|---|---|---|
| 一次 OpenCode 请求 | 125.8 | 生成 1,301 个 Token;提示词 18,539 个 Token,其中 18,364 个命中缓存;MTP 深度 3。 |
| 约 9K Token 的代码提示词 | 79.3 | 生成 1,500 个 Token;同机交替测试。2.11.2 为 62.5 tok/s。 |
| 109K Token 的 OpenCode 轮次 | 61.8 | 两次测试的平均值。 |
| 200K Token 的后续轮次 | 50.3 | 缓存已预热,两次测试的平均值。 |
125.8 tok/s 是 2026 年 9 月 16 日一次请求的实测速度。实际速度随芯片、模型版本、上下文长度和缓存状态变化。
2.11.3 版本说明(英文)模型版本与内存要求
推荐 Optimized Speed:采用动态 4-bit 量化,Qwen Sparse Attention 投影保留 8-bit 精度。Bare Speed 采用统一 4-bit 量化,更侧重生成速度。
Optimized Speed 下载约 115.1 GB,其中包含从 SSD 读取的 32 GB n-gram 表。常驻模型权重约 83 GB,还需为上下文和运行过程留出内存。Bare Speed 下载约 106.3 GB,常驻权重约 74 GB。
Hugging Face: Optimized Speed安装并开始使用
- 下载 MTPLX,将应用放入“应用程序”文件夹并打开。
- 选择适合内存容量的 Qwen 模型包,等待下载完成。
- 启动本地服务,在应用内聊天,或连接自己的编程工具。
如果使用 Homebrew,可在终端执行:
brew install youssofal/mtplx/mtplx
mtplx start安装 OpenCode 后,可通过以下命令启动本地编程会话。MTPLX 也提供兼容 OpenAI 和 Anthropic 的接口。
mtplx start opencode将 MTP 带到 Mac 的项目
Youssof Altoukhi 创建了 MTPLX,将原生多 Token 预测带到 Mac。项目于 2026 年 4 月 27 日开始开发,首个公开版本于 5 月 2 日发布。MTPLX 在 Apple 芯片上运行模型自身的 MTP 预测头,并通过精确推测采样加速本地生成。
常见问题
Flash Next 能在 32 GB Mac 上运行吗?
当前 MTPLX 模型包面向至少 96 GB 内存的 Mac。32 GB Mac 建议选择 Qwen 3.8 27B Optimized Speed。
Flash Next 和 Flash-Next 是同一个模型吗?
是。本页的 Flash Next 指 Qwen3.8-Flash-Next。模型仓库名称保留官方连字符写法。