MTPLX · Apple Silicon · v2.11.3
So führst du Qwen lokal auf deinem Mac aus.
Wähle zuerst ein Modell, das in den Arbeitsspeicher deines Macs passt. Installiere anschließend die native MTPLX-App oder die CLI über Homebrew. Nach dem Herunterladen des Modells läuft die Inferenz auf deinem eigenen Mac.
macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source
Welches Modell passt in deinen Mac?
Modellgewichte, Kontext-Cache und andere Apps teilen sich den Arbeitsspeicher. Downloadgröße und Speicherbedarf im Betrieb sind unterschiedlich.
| Gemeinsamer Arbeitsspeicher | Modell | Einsatz |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Für Macs mit weniger Arbeitsspeicher. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Empfohlen für Coding und tägliche Chats. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-Bit-Variante für höhere Modelltreue. |
| 96 GB+ | Qwen 3.8 Flash Next | Für Coding auf Macs mit viel Arbeitsspeicher. |
Lange Kontexte benötigen zusätzlichen Speicher. 96 GB sind die Einstiegskonfiguration für Flash Next, keine Zusage für das maximale Kontextfenster. Die Geschwindigkeitsmessungen stammen von einem M5 Max mit 128 GB.
Installieren und loslegen
- Lade MTPLX herunter, verschiebe die App in den Programme-Ordner und öffne sie.
- Wähle ein Qwen-Modell, das zu deinem Arbeitsspeicher passt, und lasse den Download abschließen.
- Starte den lokalen Server. Nutze den Chat in der App oder verbinde dein Coding-Tool.
Mit Homebrew kannst du diese Befehle im Terminal ausführen:
brew install youssofal/mtplx/mtplx
mtplx startWenn OpenCode installiert ist, startet dieser Befehl eine lokale Coding-Sitzung. MTPLX bietet außerdem OpenAI- und Anthropic-kompatible Schnittstellen.
mtplx start opencodeDie lokale Ausführung prüfen
Prüfe in MTPLX das geladene Modell, die Generierungsgeschwindigkeit und den Speicherbedarf. Der Server verwendet standardmäßig eine lokale Adresse. Der Modelldownload braucht Internet; Websuche und externe Tools können ebenfalls auf das Netz zugreifen.
Teste eine echte Aufgabe, etwa die Änderung einer Funktion in deinem Projekt, und stelle danach eine weitere Frage. Achte auf die Generierungsgeschwindigkeit, die Zeit bis zum ersten Token und die Wartezeit nach einem Tool-Aufruf.
Das Projekt, das MTP auf den Mac brachte
Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.
Häufige Fragen
Wie lässt sich Qwen auf einem Mac beschleunigen?
Wähle eine Engine, die das native MTP des Modells nutzt, und ein Modellpaket, das in den Arbeitsspeicher passt. MTPLX bietet MTP auf Apple Silicon und veröffentlicht Messwerte nach Modell und Kontextlänge.
Ist MTPLX kostenlos?
MTPLX ist kostenlos und unter Apache-2.0 als Open Source verfügbar. Für Modelle gelten die jeweiligen Modelllizenzen.
Welche Macs werden unterstützt?
MTPLX läuft auf Apple-Silicon-Macs mit macOS 14 oder neuer. Das passende Modell hängt vom Arbeitsspeicher ab. Für M1 und M2 stehen entsprechende FP16-kompatible Pakete im Modellkatalog.