MTPLX · Apple Silicon · v2.11.3
Qwen läuft schneller auf deinem Mac.
MTPLX ist eine native Mac-App für lokale Sprachmodelle auf Apple Silicon. Sie nutzt die Multi-Token Prediction des Modells, um Antworten schneller zu erzeugen. Du kannst lokal chatten, programmieren und OpenCode, Pi oder Claude Code mit deinem Mac verbinden. Qwen 3.8 Flash Next erreichte bei einer OpenCode-Anfrage auf dem M5 Max 125,8 tok/s.
macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source
Welches Modell passt in deinen Mac?
Modellgewichte, Kontext-Cache und andere Apps teilen sich den Arbeitsspeicher. Downloadgröße und Speicherbedarf im Betrieb sind unterschiedlich.
| Gemeinsamer Arbeitsspeicher | Modell | Einsatz |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | Für Macs mit weniger Arbeitsspeicher. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | Empfohlen für Coding und tägliche Chats. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 8-Bit-Variante für höhere Modelltreue. |
| 96 GB+ | Qwen 3.8 Flash Next | Für Coding auf Macs mit viel Arbeitsspeicher. |
Lange Kontexte benötigen zusätzlichen Speicher. 96 GB sind die Einstiegskonfiguration für Flash Next, keine Zusage für das maximale Kontextfenster. Die Geschwindigkeitsmessungen stammen von einem M5 Max mit 128 GB.
Gemessene Geschwindigkeit von Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max mit 128 GB, Optimized Speed. Sampling: Temperatur 1,0, top-p 0,95 und top-k 20.
| Aufgabe | tok/s | Testbedingungen |
|---|---|---|
| Eine OpenCode-Anfrage | 125.8 | 1.301 erzeugte Tokens; Prompt mit 18.539 Tokens, davon 18.364 aus dem Cache; MTP-Tiefe 3. |
| Code-Prompt mit etwa 9K Tokens | 79.3 | 1.500 erzeugte Tokens; abwechselnde Tests auf demselben Mac. Version 2.11.2 erreichte 62,5 tok/s. |
| OpenCode-Runde mit 109K Tokens | 61.8 | Mittelwert aus zwei Durchläufen. |
| Folgerunde mit 200K Tokens | 50.3 | Warmer Cache; Mittelwert aus zwei Durchläufen. |
125,8 tok/s wurden bei einer einzelnen Anfrage am 16. September 2026 gemessen. Chip, Modellvariante, Kontextlänge und Cache beeinflussen die tatsächlich erreichte Geschwindigkeit.
Versionshinweise zu 2.11.3 (Englisch)Installieren und loslegen
- Lade MTPLX herunter, verschiebe die App in den Programme-Ordner und öffne sie.
- Wähle ein Qwen-Modell, das zu deinem Arbeitsspeicher passt, und lasse den Download abschließen.
- Starte den lokalen Server. Nutze den Chat in der App oder verbinde dein Coding-Tool.
Mit Homebrew kannst du diese Befehle im Terminal ausführen:
brew install youssofal/mtplx/mtplx
mtplx startWenn OpenCode installiert ist, startet dieser Befehl eine lokale Coding-Sitzung. MTPLX bietet außerdem OpenAI- und Anthropic-kompatible Schnittstellen.
mtplx start opencodeDas Projekt, das MTP auf den Mac brachte
Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.
Häufige Fragen
Wie lässt sich Qwen auf einem Mac beschleunigen?
Wähle eine Engine, die das native MTP des Modells nutzt, und ein Modellpaket, das in den Arbeitsspeicher passt. MTPLX bietet MTP auf Apple Silicon und veröffentlicht Messwerte nach Modell und Kontextlänge.
Ist MTPLX kostenlos?
MTPLX ist kostenlos und unter Apache-2.0 als Open Source verfügbar. Für Modelle gelten die jeweiligen Modelllizenzen.
Welche Macs werden unterstützt?
MTPLX läuft auf Apple-Silicon-Macs mit macOS 14 oder neuer. Das passende Modell hängt vom Arbeitsspeicher ab. Für M1 und M2 stehen entsprechende FP16-kompatible Pakete im Modellkatalog.