MTPLX · Apple Silicon · v2.11.3
Cómo ejecutar Qwen en local en tu Mac.
Primero elige un modelo que quepa en la memoria unificada de tu Mac. Después instala la aplicación MTPLX o su CLI mediante Homebrew. Una vez descargado el modelo, la inferencia se ejecuta en tu propio Mac.
macOS 14 o posterior · Apple Silicon · Gratis y de código abierto
Elige el modelo según la memoria de tu Mac
Los pesos del modelo, la caché de contexto y las demás aplicaciones comparten memoria. El tamaño de descarga es distinto del consumo durante la ejecución.
| Memoria unificada | Modelo | Uso |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Para Mac con menos memoria. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Recomendado para programar y chatear a diario. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | Variante de 8 bits para mayor fidelidad al modelo. |
| 96 GB+ | Qwen 3.8 Flash Next | Para programar en Mac con mucha memoria. |
Los contextos largos requieren memoria adicional. 96 GB es la configuración mínima para Flash Next, sin garantizar su contexto máximo. Las velocidades publicadas proceden de un M5 Max con 128 GB.
Instala MTPLX y empieza a usarlo
- Descarga MTPLX, mueve la aplicación a la carpeta Aplicaciones y ábrela.
- Elige un modelo Qwen adecuado para tu memoria y espera a que termine la descarga.
- Inicia el servidor local y usa el chat de la aplicación o conecta tu herramienta de programación.
Si utilizas Homebrew, ejecuta estos comandos en el terminal:
brew install youssofal/mtplx/mtplx
mtplx startCon OpenCode instalado, este comando inicia una sesión de programación local. MTPLX también ofrece API compatibles con OpenAI y Anthropic.
mtplx start opencodeComprueba la ejecución local
En MTPLX, comprueba el modelo cargado, la velocidad de generación y el uso de memoria. El servidor utiliza una dirección local por defecto. La descarga del modelo necesita Internet; la búsqueda web y las herramientas externas también pueden acceder a la red.
Prueba una tarea real, como modificar una función de tu proyecto, y después haz otra pregunta. Observa la velocidad de generación, el tiempo hasta el primer token y la espera tras una llamada a herramientas.
El proyecto que llevó MTP al Mac
Youssof Altoukhi creó MTPLX y llevó la predicción nativa de varios tokens al Mac. El desarrollo comenzó el 27 de abril de 2026 y la primera versión pública llegó el 2 de mayo. MTPLX ejecuta las cabezas MTP del modelo en Apple Silicon y acelera la generación local mediante muestreo especulativo exacto.
Preguntas frecuentes
¿Cómo puedo ejecutar Qwen más rápido en Mac?
Elige un motor compatible con el MTP nativo del modelo y un paquete que se ajuste a la memoria. MTPLX ofrece MTP en Apple Silicon y publica mediciones por modelo y longitud de contexto.
¿MTPLX es gratis?
MTPLX es gratuito y de código abierto, con licencia Apache-2.0. Cada modelo mantiene su propia licencia.
¿Qué Mac son compatibles?
MTPLX funciona en Mac con Apple Silicon y macOS 14 o posterior. El modelo depende de la memoria unificada disponible. Hay paquetes compatibles con FP16 para M1 y M2.