MTPLX · Apple Silicon · v2.11.3
Programmez en local avec Qwen 3.8 27B sur Mac.
Qwen 3.8 27B convient aux tâches de programmation sur les Mac disposant d’au moins 32 Go. MTPLX conserve la tête MTP et vérifie plusieurs tokens proposés en une seule passe. Optimized Speed est la variante recommandée.
macOS 14 ou ultérieur · Apple Silicon · Gratuit et open source
Quel modèle choisir pour votre Mac ?
Les poids du modèle, le cache de contexte et les autres applications partagent la mémoire unifiée. La taille du téléchargement diffère de la mémoire nécessaire en fonctionnement.
| Mémoire unifiée | Modèle | Usage |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Pour les Mac ayant moins de mémoire. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Recommandé pour le code et les conversations. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | Variante 8 bits pour une meilleure fidélité au modèle. |
| 96 GB+ | Qwen 3.8 Flash Next | Pour coder sur un Mac doté de beaucoup de mémoire. |
Un contexte long exige davantage de mémoire. 96 Go constituent le minimum pour Flash Next et ne garantissent pas l’utilisation de son contexte maximal. Les vitesses présentées ont été mesurées sur un M5 Max de 128 Go.
Vitesse et choix de la variante 27B
Ces mesures correspondent à des tâches différentes sur M5 Max. La réécriture d’un fichier tout juste généré peut réutiliser son contenu ; elle ne représente pas une génération entièrement nouvelle.
| Tâche | tok/s | Conditions |
|---|---|---|
| Réécriture d’un fichier qui vient d’être généré | 87.6 | Optimized Speed · MTPLX 2.10.0 |
| Nouvelle tâche de programmation | 65.2 | Bare Speed · MTPLX 2.7.0 |
| Nouvelle tâche de programmation | 58.7 | Optimized Speed · MTPLX 2.7.0 |
Un autre record documenté concerne Qwen 3.6 27B : 81,74 tok/s le 2 juillet 2026, sur un test de code de 192 tokens, à température 0,6 et profondeur MTP de 3. Le décodage classique atteignait 30,37 tok/s dans le même test, soit une vitesse multipliée par 2,69. Ce résultat appartient à Qwen 3.6 27B.
Journaux du record à 81,74 tok/sInstaller MTPLX et commencer
- Téléchargez MTPLX, placez l’application dans le dossier Applications et ouvrez-la.
- Choisissez un modèle Qwen adapté à votre mémoire et attendez la fin du téléchargement.
- Démarrez le serveur local, puis utilisez le chat de l’application ou connectez votre outil de programmation.
Avec Homebrew, exécutez ces commandes dans le terminal :
brew install youssofal/mtplx/mtplx
mtplx startSi OpenCode est installé, cette commande démarre une session de programmation locale. MTPLX fournit aussi des API compatibles OpenAI et Anthropic.
mtplx start opencodeLe projet qui a apporté le MTP au Mac
Youssof Altoukhi a créé MTPLX et apporté la prédiction native de plusieurs tokens au Mac. Le développement a commencé le 27 avril 2026, avec une première version publique le 2 mai. MTPLX exécute les têtes MTP du modèle sur Apple Silicon et accélère la génération locale par échantillonnage spéculatif exact.
Questions fréquentes
Quelle variante de Qwen 3.8 27B choisir ?
Optimized Speed est recommandée dès 32 Go. Avec au moins 36 Go, Optimized Quality sur 8 bits permet de privilégier la fidélité au modèle.
Le MTP modifie-t-il la distribution d’échantillonnage ?
MTPLX utilise une acceptation par rapport de probabilités et une correction résiduelle pour conserver la distribution du modèle chargé. La quantification dépend toujours de la variante choisie.