MTPLX · Apple Silicon · v2.11.3
Rode Qwen mais rápido no seu Mac.
O MTPLX é um aplicativo nativo para executar modelos de linguagem localmente em Macs com Apple Silicon. Ele usa a previsão de múltiplos tokens do próprio modelo, chamada MTP, para acelerar a geração. Converse, programe e conecte OpenCode, Pi ou Claude Code ao seu Mac. O Qwen 3.8 Flash Next atingiu 125,8 tok/s em uma requisição do OpenCode no M5 Max.
macOS 14 ou posterior · Apple Silicon · Gratuito e de código aberto
Escolha o modelo pela memória do seu Mac
Os pesos do modelo, o cache de contexto e os outros aplicativos compartilham a memória. O tamanho do download é diferente do consumo durante a execução.
| Memória unificada | Modelo | Uso |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Para Macs com menos memória. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Recomendado para programação e conversas diárias. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | Versão de 8 bits para maior fidelidade ao modelo. |
| 96 GB+ | Qwen 3.8 Flash Next | Para programar em Macs com bastante memória. |
Contextos longos exigem memória adicional. 96 GB é a configuração mínima para Flash Next, sem garantir o contexto máximo. As velocidades apresentadas foram medidas em um M5 Max com 128 GB.
Velocidade de geração medida no Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max com 128 GB, Optimized Speed. Amostragem: temperatura 1,0, top-p 0,95 e top-k 20.
| Tarefa | tok/s | Condições |
|---|---|---|
| Uma requisição do OpenCode | 125.8 | 1.301 tokens gerados; prompt de 18.539 tokens, dos quais 18.364 vieram do cache; profundidade MTP 3. |
| Prompt de código com cerca de 9K tokens | 79.3 | 1.500 tokens gerados; testes alternados no mesmo Mac. A versão 2.11.2 atingiu 62,5 tok/s. |
| Turno do OpenCode com 109K tokens | 61.8 | Média de duas execuções. |
| Turno seguinte com 200K tokens | 50.3 | Cache aquecido; média de duas execuções. |
Os 125,8 tok/s foram medidos em uma única requisição em 16 de setembro de 2026. A velocidade depende do chip, da versão do modelo, do tamanho do contexto e do estado do cache.
Notas da versão 2.11.3 (inglês)Instale o MTPLX e comece a usar
- Baixe o MTPLX, mova o aplicativo para a pasta Aplicativos e abra-o.
- Escolha um modelo Qwen compatível com sua memória e aguarde o fim do download.
- Inicie o servidor local e use o chat do aplicativo ou conecte sua ferramenta de programação.
Se você usa Homebrew, execute estes comandos no terminal:
brew install youssofal/mtplx/mtplx
mtplx startCom o OpenCode instalado, este comando inicia uma sessão de programação local. O MTPLX também oferece APIs compatíveis com OpenAI e Anthropic.
mtplx start opencodeO projeto que trouxe MTP para o Mac
Youssof Altoukhi criou o MTPLX e trouxe a previsão nativa de múltiplos tokens para o Mac. O desenvolvimento começou em 27 de abril de 2026, e a primeira versão pública saiu em 2 de maio. O MTPLX executa os módulos MTP do modelo no Apple Silicon e acelera a geração local com amostragem especulativa exata.
Perguntas frequentes
Como executar Qwen mais rápido no Mac?
Escolha um motor compatível com o MTP nativo do modelo e um pacote adequado à memória. O MTPLX oferece MTP no Apple Silicon e publica medições por modelo e tamanho de contexto.
O MTPLX é gratuito?
O MTPLX é gratuito e de código aberto, sob a licença Apache-2.0. Cada modelo mantém sua própria licença.
Quais Macs são compatíveis?
O MTPLX funciona em Macs com Apple Silicon e macOS 14 ou posterior. O modelo depende da memória unificada disponível. Há pacotes compatíveis com FP16 para M1 e M2.