MTPLX · Apple Silicon · v2.11.3
Qwen 3.8 Flash Next schnell auf dem Mac ausführen.
Qwen3.8-Flash-Next ist ein Mixture-of-Experts-Modell mit 125 Milliarden Parametern. MTPLX nutzt seinen nativen MTP-Kopf für exaktes spekulatives Decoding. Das Modell eignet sich für Macs mit mindestens 96 GB gemeinsamem Arbeitsspeicher und lässt sich mit Coding-Tools wie OpenCode verbinden.
macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source
Gemessene Geschwindigkeit von Flash Next
MTPLX 2.11.3, MacBook Pro M5 Max mit 128 GB, Optimized Speed. Sampling: Temperatur 1,0, top-p 0,95 und top-k 20.
| Aufgabe | tok/s | Testbedingungen |
|---|---|---|
| Eine OpenCode-Anfrage | 125.8 | 1.301 erzeugte Tokens; Prompt mit 18.539 Tokens, davon 18.364 aus dem Cache; MTP-Tiefe 3. |
| Code-Prompt mit etwa 9K Tokens | 79.3 | 1.500 erzeugte Tokens; abwechselnde Tests auf demselben Mac. Version 2.11.2 erreichte 62,5 tok/s. |
| OpenCode-Runde mit 109K Tokens | 61.8 | Mittelwert aus zwei Durchläufen. |
| Folgerunde mit 200K Tokens | 50.3 | Warmer Cache; Mittelwert aus zwei Durchläufen. |
125,8 tok/s wurden bei einer einzelnen Anfrage am 16. September 2026 gemessen. Chip, Modellvariante, Kontextlänge und Cache beeinflussen die tatsächlich erreichte Geschwindigkeit.
Versionshinweise zu 2.11.3 (Englisch)Modellvarianten und Speicherbedarf
Optimized Speed nutzt dynamische 4-Bit-Quantisierung und behält die Projektionen von Qwen Sparse Attention in 8 Bit. Diese Variante wird empfohlen. Bare Speed verwendet durchgehend 4 Bit und ist auf höhere Geschwindigkeit ausgelegt.
Der Download von Optimized Speed umfasst etwa 115,1 GB, einschließlich einer 32-GB-n-Gramm-Tabelle, die von der SSD gelesen wird. Rund 83 GB Modellgewichte bleiben im Speicher; Kontext und Berechnung brauchen weiteren Platz. Bare Speed benötigt etwa 106,3 GB Download und 74 GB für die residenten Gewichte.
Hugging Face: Optimized SpeedInstallieren und loslegen
- Lade MTPLX herunter, verschiebe die App in den Programme-Ordner und öffne sie.
- Wähle ein Qwen-Modell, das zu deinem Arbeitsspeicher passt, und lasse den Download abschließen.
- Starte den lokalen Server. Nutze den Chat in der App oder verbinde dein Coding-Tool.
Mit Homebrew kannst du diese Befehle im Terminal ausführen:
brew install youssofal/mtplx/mtplx
mtplx startWenn OpenCode installiert ist, startet dieser Befehl eine lokale Coding-Sitzung. MTPLX bietet außerdem OpenAI- und Anthropic-kompatible Schnittstellen.
mtplx start opencodeDas Projekt, das MTP auf den Mac brachte
Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.
Häufige Fragen
Läuft Flash Next auf einem Mac mit 32 GB?
Die aktuellen MTPLX-Pakete sind für Macs ab 96 GB ausgelegt. Bei 32 GB ist Qwen 3.8 27B Optimized Speed die passende Empfehlung.
Sind Flash Next und Flash-Next dasselbe Modell?
Ja. Gemeint ist Qwen3.8-Flash-Next. Modell-Repositories verwenden die offizielle Schreibweise mit Bindestrichen.