MTPLX · Apple Silicon · v2.11.3
Ejecuta Qwen 3.8 Flash Next a gran velocidad en Mac.
Qwen3.8-Flash-Next es un modelo de mezcla de expertos con 125 mil millones de parámetros. MTPLX conserva su cabeza MTP nativa y acelera la generación con decodificación especulativa exacta. Está pensado para Mac con al menos 96 GB de memoria unificada y se conecta a herramientas de programación como OpenCode.
macOS 14 o posterior · Apple Silicon · Gratis y de código abierto
Velocidad de generación medida en Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max con 128 GB, Optimized Speed. Muestreo: temperatura 1,0, top-p 0,95 y top-k 20.
| Tarea | tok/s | Condiciones |
|---|---|---|
| Una petición de OpenCode | 125.8 | 1.301 tokens generados; prompt de 18.539 tokens, de los que 18.364 estaban en caché; profundidad MTP 3. |
| Prompt de código de unos 9K tokens | 79.3 | 1.500 tokens generados; pruebas alternadas en el mismo Mac. La versión 2.11.2 alcanzó 62,5 tok/s. |
| Turno de OpenCode de 109K tokens | 61.8 | Media de dos pruebas. |
| Turno posterior de 200K tokens | 50.3 | Caché preparada; media de dos pruebas. |
Los 125,8 tok/s corresponden a una sola petición del 16 de septiembre de 2026. La velocidad depende del chip, la variante del modelo, la longitud del contexto y el estado de la caché.
Notas de la versión 2.11.3 (inglés)Variantes y requisitos de memoria
Optimized Speed emplea cuantización dinámica de 4 bits y mantiene las proyecciones de Qwen Sparse Attention en 8 bits. Es la variante recomendada. Bare Speed usa cuantización uniforme de 4 bits y prioriza la velocidad.
La descarga de Optimized Speed ocupa unos 115,1 GB, incluida una tabla n-gram de 32 GB que se lee desde el SSD. Unos 83 GB de pesos permanecen en memoria, además del espacio necesario para el contexto y los cálculos. Bare Speed ocupa unos 106,3 GB de descarga y 74 GB de pesos residentes.
Hugging Face: Optimized SpeedInstala MTPLX y empieza a usarlo
- Descarga MTPLX, mueve la aplicación a la carpeta Aplicaciones y ábrela.
- Elige un modelo Qwen adecuado para tu memoria y espera a que termine la descarga.
- Inicia el servidor local y usa el chat de la aplicación o conecta tu herramienta de programación.
Si utilizas Homebrew, ejecuta estos comandos en el terminal:
brew install youssofal/mtplx/mtplx
mtplx startCon OpenCode instalado, este comando inicia una sesión de programación local. MTPLX también ofrece API compatibles con OpenAI y Anthropic.
mtplx start opencodeEl proyecto que llevó MTP al Mac
Youssof Altoukhi creó MTPLX y llevó la predicción nativa de varios tokens al Mac. El desarrollo comenzó el 27 de abril de 2026 y la primera versión pública llegó el 2 de mayo. MTPLX ejecuta las cabezas MTP del modelo en Apple Silicon y acelera la generación local mediante muestreo especulativo exacto.
Preguntas frecuentes
¿Puedo usar Flash Next en un Mac de 32 GB?
Los paquetes actuales de MTPLX están destinados a Mac con al menos 96 GB. Para 32 GB, se recomienda Qwen 3.8 27B Optimized Speed.
¿Flash Next y Flash-Next son el mismo modelo?
Sí. Ambos nombres se refieren a Qwen3.8-Flash-Next. Los repositorios conservan el nombre oficial con guiones.