MTPLX Für Mac herunterladen

MTPLX · Apple Silicon · v2.11.3

Qwen 3.8 Flash Next schnell auf dem Mac ausführen.

Qwen3.8-Flash-Next ist ein Mixture-of-Experts-Modell mit 125 Milliarden Parametern. MTPLX nutzt seinen nativen MTP-Kopf für exaktes spekulatives Decoding. Das Modell eignet sich für Macs mit mindestens 96 GB gemeinsamem Arbeitsspeicher und lässt sich mit Coding-Tools wie OpenCode verbinden.

macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source

Gemessene Geschwindigkeit von Flash Next

MTPLX 2.11.3, MacBook Pro M5 Max mit 128 GB, Optimized Speed. Sampling: Temperatur 1,0, top-p 0,95 und top-k 20.

Aufgabetok/sTestbedingungen
Eine OpenCode-Anfrage125.81.301 erzeugte Tokens; Prompt mit 18.539 Tokens, davon 18.364 aus dem Cache; MTP-Tiefe 3.
Code-Prompt mit etwa 9K Tokens79.31.500 erzeugte Tokens; abwechselnde Tests auf demselben Mac. Version 2.11.2 erreichte 62,5 tok/s.
OpenCode-Runde mit 109K Tokens61.8Mittelwert aus zwei Durchläufen.
Folgerunde mit 200K Tokens50.3Warmer Cache; Mittelwert aus zwei Durchläufen.

125,8 tok/s wurden bei einer einzelnen Anfrage am 16. September 2026 gemessen. Chip, Modellvariante, Kontextlänge und Cache beeinflussen die tatsächlich erreichte Geschwindigkeit.

Versionshinweise zu 2.11.3 (Englisch)

Modellvarianten und Speicherbedarf

Optimized Speed nutzt dynamische 4-Bit-Quantisierung und behält die Projektionen von Qwen Sparse Attention in 8 Bit. Diese Variante wird empfohlen. Bare Speed verwendet durchgehend 4 Bit und ist auf höhere Geschwindigkeit ausgelegt.

Der Download von Optimized Speed umfasst etwa 115,1 GB, einschließlich einer 32-GB-n-Gramm-Tabelle, die von der SSD gelesen wird. Rund 83 GB Modellgewichte bleiben im Speicher; Kontext und Berechnung brauchen weiteren Platz. Bare Speed benötigt etwa 106,3 GB Download und 74 GB für die residenten Gewichte.

Hugging Face: Optimized Speed

Installieren und loslegen

  1. Lade MTPLX herunter, verschiebe die App in den Programme-Ordner und öffne sie.
  2. Wähle ein Qwen-Modell, das zu deinem Arbeitsspeicher passt, und lasse den Download abschließen.
  3. Starte den lokalen Server. Nutze den Chat in der App oder verbinde dein Coding-Tool.

Für Mac herunterladen

Mit Homebrew kannst du diese Befehle im Terminal ausführen:

brew install youssofal/mtplx/mtplx
mtplx start

Wenn OpenCode installiert ist, startet dieser Befehl eine lokale Coding-Sitzung. MTPLX bietet außerdem OpenAI- und Anthropic-kompatible Schnittstellen.

mtplx start opencode

Das Projekt, das MTP auf den Mac brachte

Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.

Wie MTP auf den Mac kam (Englisch)

Häufige Fragen

Läuft Flash Next auf einem Mac mit 32 GB?

Die aktuellen MTPLX-Pakete sind für Macs ab 96 GB ausgelegt. Bei 32 GB ist Qwen 3.8 27B Optimized Speed die passende Empfehlung.

Sind Flash Next und Flash-Next dasselbe Modell?

Ja. Gemeint ist Qwen3.8-Flash-Next. Modell-Repositories verwenden die offizielle Schreibweise mit Bindestrichen.

Quellen und Messungen