MTPLX · Apple Silicon · v2.11.3
Comment exécuter Qwen en local sur votre Mac.
Choisissez d’abord un modèle adapté à la mémoire unifiée de votre Mac. Installez ensuite l’application MTPLX ou la CLI avec Homebrew. Une fois le modèle téléchargé, l’inférence s’effectue sur votre propre Mac.
macOS 14 ou ultérieur · Apple Silicon · Gratuit et open source
Quel modèle choisir pour votre Mac ?
Les poids du modèle, le cache de contexte et les autres applications partagent la mémoire unifiée. La taille du téléchargement diffère de la mémoire nécessaire en fonctionnement.
| Mémoire unifiée | Modèle | Usage |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Pour les Mac ayant moins de mémoire. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Recommandé pour le code et les conversations. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | Variante 8 bits pour une meilleure fidélité au modèle. |
| 96 GB+ | Qwen 3.8 Flash Next | Pour coder sur un Mac doté de beaucoup de mémoire. |
Un contexte long exige davantage de mémoire. 96 Go constituent le minimum pour Flash Next et ne garantissent pas l’utilisation de son contexte maximal. Les vitesses présentées ont été mesurées sur un M5 Max de 128 Go.
Installer MTPLX et commencer
- Téléchargez MTPLX, placez l’application dans le dossier Applications et ouvrez-la.
- Choisissez un modèle Qwen adapté à votre mémoire et attendez la fin du téléchargement.
- Démarrez le serveur local, puis utilisez le chat de l’application ou connectez votre outil de programmation.
Avec Homebrew, exécutez ces commandes dans le terminal :
brew install youssofal/mtplx/mtplx
mtplx startSi OpenCode est installé, cette commande démarre une session de programmation locale. MTPLX fournit aussi des API compatibles OpenAI et Anthropic.
mtplx start opencodeVérifier l’exécution locale
Dans MTPLX, vérifiez le modèle chargé, la vitesse de génération et la mémoire utilisée. Le serveur utilise une adresse locale par défaut. Le téléchargement du modèle nécessite Internet ; la recherche web et les outils externes peuvent également accéder au réseau.
Essayez une vraie tâche, par exemple modifier une fonction dans votre projet, puis posez une question complémentaire. Observez la vitesse de génération, le délai avant le premier token et l’attente après un appel d’outil.
Le projet qui a apporté le MTP au Mac
Youssof Altoukhi a créé MTPLX et apporté la prédiction native de plusieurs tokens au Mac. Le développement a commencé le 27 avril 2026, avec une première version publique le 2 mai. MTPLX exécute les têtes MTP du modèle sur Apple Silicon et accélère la génération locale par échantillonnage spéculatif exact.
Questions fréquentes
Comment faire tourner Qwen plus vite sur Mac ?
Choisissez un moteur utilisant le MTP natif du modèle et une variante adaptée à votre mémoire. MTPLX propose le MTP sur Apple Silicon et publie des mesures par modèle et longueur de contexte.
MTPLX est-il gratuit ?
MTPLX est gratuit et open source, sous licence Apache-2.0. Les modèles conservent leurs propres licences.
Quels Mac sont compatibles ?
MTPLX fonctionne sur les Mac Apple Silicon avec macOS 14 ou ultérieur. Le choix du modèle dépend de la mémoire unifiée. Des variantes compatibles FP16 sont disponibles pour M1 et M2.