MTPLX Mac용 다운로드

MTPLX · Apple Silicon · v2.11.3

Mac의 Qwen 3.8 27B로 로컬에서 코딩하세요.

Qwen 3.8 27B는 메모리가 32 GB 이상인 Mac에서 코딩하기에 적합한 모델입니다. MTPLX는 MTP 헤드를 유지하고 여러 후보 토큰을 한 번에 검증해 생성 대기 시간을 줄입니다. 기본 권장 모델은 Optimized Speed입니다.

macOS 14 이상 · Apple Silicon · 무료 오픈 소스

Mac 메모리에 맞는 모델 선택

모델 가중치, 컨텍스트 캐시, 다른 앱이 통합 메모리를 함께 사용합니다. 다운로드 크기와 실행 중 메모리 사용량은 다릅니다.

통합 메모리모델용도
16 GB+Qwen 3.5 4B / 9B메모리 용량이 작은 Mac에 적합합니다.
32 GB+Qwen 3.8 27B Optimized Speed코딩과 일상적인 대화에 권장합니다.
36 GB+Qwen 3.8 27B Optimized Quality모델 정밀도를 우선하는 8비트 버전입니다.
96 GB+Qwen 3.8 Flash Next메모리가 넉넉한 Mac의 코딩 작업에 적합합니다.

긴 컨텍스트에는 메모리가 더 필요합니다. 96 GB는 Flash Next의 최소 구성이며 최대 컨텍스트 사용을 보장하지 않습니다. 여기에 제시한 속도는 M5 Max 128 GB에서 측정했습니다.

27B 모델의 속도와 버전 선택

다음은 M5 Max에서 서로 다른 작업을 실행한 측정값입니다. 방금 생성한 파일을 다시 작성할 때는 기존 내용을 재사용할 수 있으므로 완전히 새로운 내용을 생성하는 작업과 조건이 다릅니다.

작업tok/s측정 조건
방금 생성한 파일 다시 작성87.6Optimized Speed · MTPLX 2.10.0
새로운 코딩 작업65.2Bare Speed · MTPLX 2.7.0
새로운 코딩 작업58.7Optimized Speed · MTPLX 2.7.0

Qwen 3.6 27B에는 별도의 기록이 있습니다. 2026년 7월 2일, 192토큰 코드 테스트에서 temperature 0.6, MTP 깊이 3으로 81.74 tok/s를 기록했습니다. 같은 테스트의 일반 디코딩은 30.37 tok/s로, MTP 사용 시 2.69배 빨랐습니다. 이 기록은 Qwen 3.6 27B의 결과입니다.

81.74 tok/s 측정 로그

설치하고 시작하기

  1. MTPLX를 다운로드하고 응용 프로그램 폴더로 옮긴 뒤 실행하세요.
  2. 메모리에 맞는 Qwen 모델을 선택하고 다운로드가 끝날 때까지 기다리세요.
  3. 로컬 서버를 시작하고 앱에서 대화하거나 코딩 도구를 연결하세요.

Mac용 다운로드

Homebrew를 사용한다면 터미널에서 다음 명령어를 실행하세요.

brew install youssofal/mtplx/mtplx
mtplx start

OpenCode가 설치되어 있다면 다음 명령어로 로컬 코딩 세션을 시작할 수 있습니다. MTPLX는 OpenAI 및 Anthropic 호환 API도 제공합니다.

mtplx start opencode

Mac에 MTP를 도입한 프로젝트

Youssof Altoukhi는 MTPLX를 만들고 Mac에 네이티브 다중 토큰 예측을 도입했습니다. 개발은 2026년 4월 27일 시작했으며 첫 공개 버전은 5월 2일 출시했습니다. MTPLX는 Apple Silicon에서 모델 자체의 MTP 헤드를 실행하고 정확한 추측 샘플링으로 로컬 생성을 가속합니다.

Mac에 MTP를 구현한 과정 (영문)

자주 묻는 질문

Qwen 3.8 27B는 어떤 버전을 선택해야 하나요?

32 GB 이상에서는 Optimized Speed를 권장합니다. 정밀도를 우선하고 메모리가 36 GB 이상이라면 8비트 Optimized Quality를 선택할 수 있습니다.

MTP가 샘플링 분포를 바꾸나요?

MTPLX는 확률비 기반 수락과 잔차 보정을 사용해 로드한 모델의 샘플링 분포를 유지합니다. 양자화로 인한 차이는 선택한 모델 패키지에 따라 달라집니다.

측정 자료와 출처