MTPLX · Apple Silicon · v2.11.3
Lokal programmieren mit Qwen 3.8 27B auf dem Mac.
Qwen 3.8 27B ist eine praktische Wahl für Coding-Aufgaben auf Macs ab 32 GB. MTPLX behält den MTP-Kopf des Modells bei und prüft mehrere vorgeschlagene Tokens in einem Durchlauf. Optimized Speed ist die empfohlene Modellvariante.
macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source
Welches Modell passt in deinen Mac?
Modellgewichte, Kontext-Cache und andere Apps teilen sich den Arbeitsspeicher. Downloadgröße und Speicherbedarf im Betrieb sind unterschiedlich.
| Gemeinsamer Arbeitsspeicher | Modell | Einsatz |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Für Macs mit weniger Arbeitsspeicher. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Empfohlen für Coding und tägliche Chats. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-Bit-Variante für höhere Modelltreue. |
| 96 GB+ | Qwen 3.8 Flash Next | Für Coding auf Macs mit viel Arbeitsspeicher. |
Lange Kontexte benötigen zusätzlichen Speicher. 96 GB sind die Einstiegskonfiguration für Flash Next, keine Zusage für das maximale Kontextfenster. Die Geschwindigkeitsmessungen stammen von einem M5 Max mit 128 GB.
Geschwindigkeit und Modellvarianten des 27B
Diese Messungen stammen aus unterschiedlichen Aufgaben auf dem M5 Max. Beim Überarbeiten einer gerade erzeugten Datei kann vorhandener Inhalt wiederverwendet werden; das Ergebnis ist nicht mit einer vollständig neuen Generierung gleichzusetzen.
| Aufgabe | tok/s | Testbedingungen |
|---|---|---|
| Gerade erzeugte Datei überarbeiten | 87.6 | Optimized Speed · MTPLX 2.10.0 |
| Neue Coding-Aufgabe | 65.2 | Bare Speed · MTPLX 2.7.0 |
| Neue Coding-Aufgabe | 58.7 | Optimized Speed · MTPLX 2.7.0 |
Ein weiterer dokumentierter Rekord gehört zu Qwen 3.6 27B: 81,74 tok/s am 2. Juli 2026, bei einem Coding-Test mit 192 Tokens, Temperatur 0,6 und MTP-Tiefe 3. Ohne MTP waren es im selben Test 30,37 tok/s. Das entspricht dem 2,69-Fachen. Dieser Wert gehört zu Qwen 3.6 27B.
Originalprotokolle zum Rekord von 81,74 tok/sInstallieren und loslegen
- Lade MTPLX herunter, verschiebe die App in den Programme-Ordner und öffne sie.
- Wähle ein Qwen-Modell, das zu deinem Arbeitsspeicher passt, und lasse den Download abschließen.
- Starte den lokalen Server. Nutze den Chat in der App oder verbinde dein Coding-Tool.
Mit Homebrew kannst du diese Befehle im Terminal ausführen:
brew install youssofal/mtplx/mtplx
mtplx startWenn OpenCode installiert ist, startet dieser Befehl eine lokale Coding-Sitzung. MTPLX bietet außerdem OpenAI- und Anthropic-kompatible Schnittstellen.
mtplx start opencodeDas Projekt, das MTP auf den Mac brachte
Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.
Häufige Fragen
Welche Qwen-3.8-27B-Variante soll ich wählen?
Ab 32 GB wird Optimized Speed empfohlen. Optimized Quality nutzt 8 Bit und eignet sich ab 36 GB, wenn dir höhere Modelltreue wichtiger ist.
Verändert MTP die Sampling-Verteilung?
MTPLX verwendet Wahrscheinlichkeitsverhältnisse und eine Residualkorrektur, um die Verteilung des geladenen Modells zu erhalten. Unterschiede durch Quantisierung hängen weiterhin vom gewählten Modellpaket ab.