MTPLX · Apple Silicon · v2.11.3
Ejecuta Qwen más rápido en tu Mac.
MTPLX es una aplicación nativa de Mac para modelos de lenguaje locales en Apple Silicon. Utiliza la predicción de varios tokens del propio modelo, o MTP, para acelerar la generación. Puedes chatear, programar y conectar OpenCode, Pi o Claude Code a tu Mac. Qwen 3.8 Flash Next alcanzó 125,8 tok/s en una petición de OpenCode con un M5 Max.
macOS 14 o posterior · Apple Silicon · Gratis y de código abierto
Elige el modelo según la memoria de tu Mac
Los pesos del modelo, la caché de contexto y las demás aplicaciones comparten memoria. El tamaño de descarga es distinto del consumo durante la ejecución.
| Memoria unificada | Modelo | Uso |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Para Mac con menos memoria. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Recomendado para programar y chatear a diario. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | Variante de 8 bits para mayor fidelidad al modelo. |
| 96 GB+ | Qwen 3.8 Flash Next | Para programar en Mac con mucha memoria. |
Los contextos largos requieren memoria adicional. 96 GB es la configuración mínima para Flash Next, sin garantizar su contexto máximo. Las velocidades publicadas proceden de un M5 Max con 128 GB.
Velocidad de generación medida en Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max con 128 GB, Optimized Speed. Muestreo: temperatura 1,0, top-p 0,95 y top-k 20.
| Tarea | tok/s | Condiciones |
|---|---|---|
| Una petición de OpenCode | 125.8 | 1.301 tokens generados; prompt de 18.539 tokens, de los que 18.364 estaban en caché; profundidad MTP 3. |
| Prompt de código de unos 9K tokens | 79.3 | 1.500 tokens generados; pruebas alternadas en el mismo Mac. La versión 2.11.2 alcanzó 62,5 tok/s. |
| Turno de OpenCode de 109K tokens | 61.8 | Media de dos pruebas. |
| Turno posterior de 200K tokens | 50.3 | Caché preparada; media de dos pruebas. |
Los 125,8 tok/s corresponden a una sola petición del 16 de septiembre de 2026. La velocidad depende del chip, la variante del modelo, la longitud del contexto y el estado de la caché.
Notas de la versión 2.11.3 (inglés)Instala MTPLX y empieza a usarlo
- Descarga MTPLX, mueve la aplicación a la carpeta Aplicaciones y ábrela.
- Elige un modelo Qwen adecuado para tu memoria y espera a que termine la descarga.
- Inicia el servidor local y usa el chat de la aplicación o conecta tu herramienta de programación.
Si utilizas Homebrew, ejecuta estos comandos en el terminal:
brew install youssofal/mtplx/mtplx
mtplx startCon OpenCode instalado, este comando inicia una sesión de programación local. MTPLX también ofrece API compatibles con OpenAI y Anthropic.
mtplx start opencodeEl proyecto que llevó MTP al Mac
Youssof Altoukhi creó MTPLX y llevó la predicción nativa de varios tokens al Mac. El desarrollo comenzó el 27 de abril de 2026 y la primera versión pública llegó el 2 de mayo. MTPLX ejecuta las cabezas MTP del modelo en Apple Silicon y acelera la generación local mediante muestreo especulativo exacto.
Preguntas frecuentes
¿Cómo puedo ejecutar Qwen más rápido en Mac?
Elige un motor compatible con el MTP nativo del modelo y un paquete que se ajuste a la memoria. MTPLX ofrece MTP en Apple Silicon y publica mediciones por modelo y longitud de contexto.
¿MTPLX es gratis?
MTPLX es gratuito y de código abierto, con licencia Apache-2.0. Cada modelo mantiene su propia licencia.
¿Qué Mac son compatibles?
MTPLX funciona en Mac con Apple Silicon y macOS 14 o posterior. El modelo depende de la memoria unificada disponible. Hay paquetes compatibles con FP16 para M1 y M2.