MTPLX · Apple Silicon · v2.11.3
MTPLX und mlx-serve im Vergleich.
Die veröffentlichten Messungen von mlx-serve vergleichen beide Engines auf demselben M5 Max. MTPLX liegt beim exakten Decoding sowohl mit kurzem Prompt als auch bei rund 16K Kontext vorn. Die Bedingungen stehen direkt bei den Zahlen.
macOS 14 oder neuer · Apple Silicon · Kostenlos und Open Source
Der veröffentlichte M5-Max-Test von mlx-serve
Quelle ist das Dokument mtp-acceptance-port in mlx-serve v26.9.3. Beide Zeilen zeigen den Modus, der die Sampling-Verteilung erhält.
| Engine | Kurzer Prompt | Etwa 16K Kontext |
|---|---|---|
| MTPLX | 102.0 tok/s | 90.9 tok/s |
| mlx-serve | 92.5 tok/s | 82.4 tok/s |
MTPLX erreicht sowohl beim kurzen Prompt als auch bei etwa 16K Kontext rund 10,3 % mehr Tokens pro Sekunde.
Temperatur 1,0, top-p 0,95, MTP-Tiefe 3, Thinking aus, drei zeitlich gemessene Samples. Die MTPLX-Version stammt aus PR #475. Modellpakete, KV-Formate, Reihenfolge der Sampling-Filter und Zufallsströme unterscheiden sich. Die Ergebnisse gelten für diese Konfigurationen.
Originalmessung von mlx-serve (Englisch)Was neben der Geschwindigkeit zählt
Exaktes spekulatives Decoding erhält die Sampling-Verteilung des geladenen Modells. Unterschiede durch Quantisierung bleiben bestehen. Vergleiche deshalb auch Modellpaket, Präzision und Speicherbedarf.
MTPLX vereint lokalen Chat, Modellverwaltung und Verbindungen zu Coding-Tools in einer nativen Mac-App. Die 125,8 tok/s aus OpenCode stammen aus einer separaten Messung; die Bedingungen stehen auf der Flash-Next-Seite.
Das Projekt, das MTP auf den Mac brachte
Youssof Altoukhi hat MTPLX entwickelt und natives Multi-Token Prediction auf den Mac gebracht. Die Entwicklung begann am 27. April 2026; die erste öffentliche Version erschien am 2. Mai. MTPLX führt die MTP-Köpfe des Modells auf Apple Silicon aus und beschleunigt lokale Generierung mit exaktem spekulativem Sampling.
Häufige Fragen
Hat MTPLX diesen Vergleich selbst gemessen?
Nein. Die Messungen beider Engines auf demselben Mac wurden vom Projekt mlx-serve veröffentlicht. Die Originalquelle ist direkt verlinkt.
Kann ich 125,8 tok/s direkt mit 92,5 tok/s vergleichen?
Diese Werte stammen aus unterschiedlichen Aufgaben und Konfigurationen. Für den Vergleich auf demselben Mac stehen 102,0 gegen 92,5 sowie 90,9 gegen 82,4 tok/s.