MTPLX Mac용 다운로드

MTPLX · Apple Silicon · v2.11.3

MTPLX와 mlx-serve의 Mac 성능을 비교하세요.

mlx-serve가 공개한 측정은 같은 M5 Max에서 두 엔진을 비교합니다. MTPLX는 짧은 프롬프트와 약 16K 컨텍스트 모두에서 정확한 디코딩 속도가 더 높았습니다. 모델 선택에 도움이 되도록 측정 조건을 함께 제공합니다.

macOS 14 이상 · Apple Silicon · 무료 오픈 소스

mlx-serve가 공개한 M5 Max 측정

출처는 mlx-serve v26.9.3의 mtp-acceptance-port 문서입니다. 아래 두 행은 모두 샘플링 분포를 유지하는 모드의 결과입니다.

엔진짧은 프롬프트약 16K 컨텍스트
MTPLX102.0 tok/s90.9 tok/s
mlx-serve92.5 tok/s82.4 tok/s

MTPLX는 짧은 프롬프트와 약 16K 컨텍스트 모두에서 초당 생성 토큰 수가 약 10.3% 높았습니다.

temperature 1.0, top-p 0.95, MTP 깊이 3, 추론 모드 비활성화 상태에서 세 번 측정했습니다. MTPLX는 PR #475 빌드입니다. 모델 패키지, KV 형식, 샘플링 필터 순서와 난수 흐름이 다르므로 이 결과는 해당 구성의 비교입니다.

mlx-serve 원본 측정표 (영문)

속도와 함께 살펴볼 요소

정확한 추측 디코딩은 로드한 모델의 샘플링 분포를 유지합니다. 양자화에 따른 차이는 남으므로 모델 패키지, 정밀도와 메모리 요구량도 비교해야 합니다.

MTPLX는 로컬 채팅, 모델 관리와 코딩 도구 연결을 네이티브 Mac 앱에서 제공합니다. OpenCode의 125.8 tok/s 결과는 별도 측정이며 자세한 조건은 Flash Next 페이지에 있습니다.

Mac에 MTP를 도입한 프로젝트

Youssof Altoukhi는 MTPLX를 만들고 Mac에 네이티브 다중 토큰 예측을 도입했습니다. 개발은 2026년 4월 27일 시작했으며 첫 공개 버전은 5월 2일 출시했습니다. MTPLX는 Apple Silicon에서 모델 자체의 MTP 헤드를 실행하고 정확한 추측 샘플링으로 로컬 생성을 가속합니다.

Mac에 MTP를 구현한 과정 (영문)

자주 묻는 질문

이 비교를 MTPLX가 직접 측정했나요?

아닙니다. mlx-serve 프로젝트가 같은 Mac에서 두 엔진을 측정해 공개한 자료입니다. 이 페이지에 원문 링크가 있습니다.

125.8 tok/s와 92.5 tok/s를 바로 비교해도 되나요?

작업과 설정이 다릅니다. 같은 Mac에서의 비교에는 102.0 대 92.5, 90.9 대 82.4 tok/s를 사용해야 합니다.

측정 자료와 출처