MTPLX · Apple Silicon · v2.11.3
Execute Qwen 3.8 Flash Next em alta velocidade no Mac.
O Qwen3.8-Flash-Next é um modelo de mistura de especialistas com 125 bilhões de parâmetros. O MTPLX preserva seu módulo MTP nativo e acelera a geração com decodificação especulativa exata. Ele atende Macs com pelo menos 96 GB de memória unificada e se conecta a ferramentas de programação como o OpenCode.
macOS 14 ou posterior · Apple Silicon · Gratuito e de código aberto
Velocidade de geração medida no Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max com 128 GB, Optimized Speed. Amostragem: temperatura 1,0, top-p 0,95 e top-k 20.
| Tarefa | tok/s | Condições |
|---|---|---|
| Uma requisição do OpenCode | 125.8 | 1.301 tokens gerados; prompt de 18.539 tokens, dos quais 18.364 vieram do cache; profundidade MTP 3. |
| Prompt de código com cerca de 9K tokens | 79.3 | 1.500 tokens gerados; testes alternados no mesmo Mac. A versão 2.11.2 atingiu 62,5 tok/s. |
| Turno do OpenCode com 109K tokens | 61.8 | Média de duas execuções. |
| Turno seguinte com 200K tokens | 50.3 | Cache aquecido; média de duas execuções. |
Os 125,8 tok/s foram medidos em uma única requisição em 16 de setembro de 2026. A velocidade depende do chip, da versão do modelo, do tamanho do contexto e do estado do cache.
Notas da versão 2.11.3 (inglês)Versões e requisitos de memória
Optimized Speed usa quantização dinâmica de 4 bits e mantém as projeções de Qwen Sparse Attention em 8 bits. É a versão recomendada. Bare Speed usa quantização uniforme de 4 bits e prioriza a velocidade.
O download de Optimized Speed tem cerca de 115,1 GB, incluindo uma tabela n-gram de 32 GB lida do SSD. Cerca de 83 GB de pesos ficam na memória, além do espaço para contexto e cálculos. Bare Speed tem download de aproximadamente 106,3 GB e 74 GB de pesos residentes.
Hugging Face: Optimized SpeedInstale o MTPLX e comece a usar
- Baixe o MTPLX, mova o aplicativo para a pasta Aplicativos e abra-o.
- Escolha um modelo Qwen compatível com sua memória e aguarde o fim do download.
- Inicie o servidor local e use o chat do aplicativo ou conecte sua ferramenta de programação.
Se você usa Homebrew, execute estes comandos no terminal:
brew install youssofal/mtplx/mtplx
mtplx startCom o OpenCode instalado, este comando inicia uma sessão de programação local. O MTPLX também oferece APIs compatíveis com OpenAI e Anthropic.
mtplx start opencodeO projeto que trouxe MTP para o Mac
Youssof Altoukhi criou o MTPLX e trouxe a previsão nativa de múltiplos tokens para o Mac. O desenvolvimento começou em 27 de abril de 2026, e a primeira versão pública saiu em 2 de maio. O MTPLX executa os módulos MTP do modelo no Apple Silicon e acelera a geração local com amostragem especulativa exata.
Perguntas frequentes
Flash Next funciona em um Mac de 32 GB?
Os pacotes atuais do MTPLX são destinados a Macs com pelo menos 96 GB. Para 32 GB, a recomendação é Qwen 3.8 27B Optimized Speed.
Flash Next e Flash-Next são o mesmo modelo?
Sim. Ambos se referem ao Qwen3.8-Flash-Next. Os repositórios usam o nome oficial com hífens.